这个 Skill 能做什么,适合哪些场景?
unbox-ai 是一个把 AI agent 追踪文件规范化并回答问题的 CLI 技能。它支持网关导出、opencode 会话导出和 AI SDK devtools 数据库(.devtools/generations.),全部自动检测。所有命令都是只读且输出有界的,可以放心运行,不会把几兆字节的重复上下文灌进上下文窗口。对带 @ai-sdk/devtools 埋点的应用,它甚至能在应用运行中途边写边分析,实现实时调试。
- 读取 *.trace.(网关或 opencode 导出)和 .devtools/generations.(AI SDK devtools 数据库),并自动识别格式。
- 通过 runs/summary/tools/events/event/messages/get/compare 等子命令,输出每次调用的 token、延迟、成本、工具成功与失败情况。
- 支持 -- 机器可读输出和 jq 管道做成本热点、重试循环等分析。
- compare 子命令对比两次运行:token/成本/时间差、工具集变更、系统提示词 diff,以及按工具序列对齐的轨迹表。
- 对正在写入的 devtools 数据库,每条命令读取最新快照,用 --run 圈定单个 run,可中途调试正在执行的 agent。
- 排查 agent 运行为什么又慢又贵:用 events 看每代 token 和延迟,用 jq 按段汇总成本,找出烧钱最多的 segment。
- 调试卡死的 agent:用 tools 检测同一工具加相同参数反复调用的重试循环,再用 messages --grep 找错误证据链。
- 实时调试带 @ai-sdk/devtools 埋点的应用:应用还在跑时反复读取 .devtools/generations. 快照,观察正在运行的 run。
- 评估提示词缓存的收益:看 caching 百分比和 re-paid token 数,判断是否该改用单会话或缓存友好结构。
- 对比两次 agent 运行找分歧点:用 compare --trajectory 看内容对齐的动作表,定位两次运行为何走出不同结果。
- 需要写入、重放或修改追踪文件的工作流——所有命令都是只读的。
- 不使用上述三种受支持格式(网关导出、opencode 导出、AI SDK devtools 数据库)的追踪文件;未知格式会直接报错。
- 想用图形界面深入探索的人可以由 agent 提示运行 view/devtools 可视化,但那不在本技能的 agent 命令范围内。
如何安装这个 Skill?
- 核心依赖 npx unbox-ai 来自未经验证的身份,首次运行会从 npm 拉取并执行代码,建议先审查该包或在受控环境中首次使用。
- 本次为静态审查,未执行任何命令;技能的输出格式、错误行为和配方均未实际验证。
- 技能缺少版本号与维护/更新说明,归属项目 unbox-ai 不在本仓库中,追踪上游变更需自行确认。
- 分析对象是 AI 追踪文件,可能包含提示词、密钥或业务数据;-- 与 get 命令可输出未截断的原始内容,注意在共享环境中使用时的数据暴露。
- 技能未说明中文界面或中文文档支持,且部分分析(如读取追踪内容)面向英文命令行输出。
- Shell / 命令行
- 网络访问
- 本地文件系统
Node.jsnpx unbox-ai CLIjq (for the analysis recipes)
该技能属于 tester-army/e2e 仓库中的 10 个技能合集(路径 .claude/skills/unbox-ai),源材料未提供单独的安装命令;CLI 本身通过 npx 调用:
npx unbox-ai源材料未记录将技能目录复制到 Claude Code / Codex 的具体安装步骤,请参考该仓库的技能目录自行放置。
如何使用这个 Skill?
安装后,把下面任意一句发给 Agent 即可触发:
- 帮我看看 runs/trace. 里这次 agent 运行为什么花了这么多 token,找出成本最高的 segment。
- 检查 .devtools/generations.,agent 是不是卡在某个工具的重试循环里了?
- 对比 run0. 和 run1. 这两次运行,告诉我它们从哪一步开始分歧。
- 分析这个 opencode 会话导出的缓存命中率,值不值得改成单会话?
把追踪文件路径传给子命令即可,始终先广后深:summary 看全貌,tools 看工具统计,events 看每代指标,event <idx> 深挖单代,messages --grep 搜索消息,get 取精确原始值。多 run 来源先跑 runs,再用 --run <n> 圈定范围;被截断的输出会打印返回剩余内容的精确 get 调用,照着执行即可。bash
unbox-ai summary trace.
unbox-ai events trace. -- | jq '...'
unbox-ai compare a. b. --trajectory
对实时 devtools 数据库,先用 runs,再用 --run 跟进,索引是 run 本地的;标记 [live] 的 run 仍在执行,重跑命令可看到更新状态。
这个 Skill 有哪些优点和局限?
- 所有命令只读且输出有界,不会撑爆 agent 的上下文窗口。
- 自动检测三种常见追踪格式,未知格式给出可读错误而非静默失败。
- compare --trajectory 用 LCS 对齐工具序列,能直接指出两次运行从哪一步分歧。
- 支持对正在写入的 devtools 数据库做中途实时分析,这在大多数工具里没有。
- 成本字段为 - 时(AI SDK devtools 追踪)无法给出美元金额,只能基于 token 推理。
- jq 管道的分析配方需要用户环境装有 jq。
- -- 输出无界,直接使用可能产生大量输出,需先看普通形式。
- 源材料未提供该技能的独立安装文档或测试说明。
这个 Skill 与同类方案有什么区别?
与相关 Skills 并排比较;分数均按同一 FSRS 标准得出。
| Skill | FS 评分 | Star 数 | 最近更新 | License |
|---|---|---|---|---|
| unbox-ai — AI Agent 追踪分析 CLI 本页 | 54 · 谨慎使用 | ★ 8.7k | 1 天前 | Apache-2.0 |
| OpenCLI AutoFix 适配器自动修复技能 | 58 · 推荐 | ★ 30k | 17 天前 | Apache-2.0 |
| Agents Observe | 54 · 谨慎使用 | ★ 695 | 1 个月前 | MIT |
| Playwright Trace CLI ✓ Microsoft · 官方 | 48 · 谨慎使用 | ★ 97k | 3 天前 | Apache-2.0 |
| BlockWatch | 67 · 推荐 | ★ 29 | 3 天前 | MIT |
源材料未直接点名竞品,但明确反对的替代做法是直接 cat/Read 原始追踪 JSON——追踪文件常有几兆字节的重复上下文,unbox-ai 的价值正在于用有界输出取代这种做法。
FollowSkills 如何评估这个 Skill?
技能声明所有命令只读且输出有界,并明确限制 view/devtools 等交互命令仅供人类使用,数据流透明度较高;但核心工具通过 npx unbox-ai 拉取,其源码不在本次证据中,依赖内容与供应链安全无法核实,也没有回滚或隔离说明,故未给高分。
指令自洽、工作流清晰,错误行为有描述(未知文件报可读错误、非法正则回退字面量、指针机制),但静态审查无法执行验证,npx 包的可用性与实际输出格式未证实,失败反馈质量只能凭文档判断。
触发条件在 description 中定义得相当精确(何时用、何时不用、支持三种格式并自动检测),受众与场景清晰,边界(仅支持列出的格式、cost 缺失时的退化处理)有说明;但未涉及中文支持,且格式之外的文件直接失败,兼容边界依赖文档自述。
SKILL.md 分层良好:概览→命令→读数解释→分析配方→格式→在线调试,渐进披露到位,命名稳定;但技能本身无版本号、变更记录或维护责任声明,来源归属仅指向一个未在本仓库出现的 unbox-ai 项目,许可证对技能内容的适用性未明示。
任务目标(不读原始 JSON 即可分析 agent 追踪)明确且有边际价值,配方直接给出可复制的 jq 管道;但输出正确性未经执行验证,且 npx 首次运行有下载成本,效益比例只能部分确认。
证据仅限技能文档自述;仓库内的 CI、测试套件(benchmark、agent workflows)全部针对 e2e 框架而非 unbox-ai 技能本身,没有针对该技能关键路径的第三方执行证据,故上限受限。
点击维度查看打分理由
证据充分度:低 — 主要依赖静态检查、作者材料或有限演示;适合发现线索,不适合做高风险决策。
查看完整评分方法 →