开发与工程

unbox-ai — AI Agent 追踪分析 CLI

在命令行里分析 AI agent 的追踪文件,不用去读几兆字节的原始 JSON,就能查明 agent 为什么慢、为什么贵。

54/ 100
谨慎使用

价值存在,但可靠性、证据或控制措施仍有明显缺口。

查看评分依据 ↓
可直接使用于
Codex · Claude Code
Star 数
★ 8.7k
最近更新
1 天前
License
Apache-2.0
ai-agent-tracestrace-analysisclicost-analysis
+3debuggingai-sdk-devtoolsobservability

这个 Skill 能做什么,适合哪些场景?

unbox-ai 是一个把 AI agent 追踪文件规范化并回答问题的 CLI 技能。它支持网关导出、opencode 会话导出和 AI SDK devtools 数据库(.devtools/generations.),全部自动检测。所有命令都是只读且输出有界的,可以放心运行,不会把几兆字节的重复上下文灌进上下文窗口。对带 @ai-sdk/devtools 埋点的应用,它甚至能在应用运行中途边写边分析,实现实时调试。

  • 读取 *.trace.(网关或 opencode 导出)和 .devtools/generations.(AI SDK devtools 数据库),并自动识别格式。
  • 通过 runs/summary/tools/events/event/messages/get/compare 等子命令,输出每次调用的 token、延迟、成本、工具成功与失败情况。
  • 支持 -- 机器可读输出和 jq 管道做成本热点、重试循环等分析。
  • compare 子命令对比两次运行:token/成本/时间差、工具集变更、系统提示词 diff,以及按工具序列对齐的轨迹表。
  • 对正在写入的 devtools 数据库,每条命令读取最新快照,用 --run 圈定单个 run,可中途调试正在执行的 agent。
适合
  • 排查 agent 运行为什么又慢又贵:用 events 看每代 token 和延迟,用 jq 按段汇总成本,找出烧钱最多的 segment。
  • 调试卡死的 agent:用 tools 检测同一工具加相同参数反复调用的重试循环,再用 messages --grep 找错误证据链。
  • 实时调试带 @ai-sdk/devtools 埋点的应用:应用还在跑时反复读取 .devtools/generations. 快照,观察正在运行的 run。
  • 评估提示词缓存的收益:看 caching 百分比和 re-paid token 数,判断是否该改用单会话或缓存友好结构。
  • 对比两次 agent 运行找分歧点:用 compare --trajectory 看内容对齐的动作表,定位两次运行为何走出不同结果。
不适合
  • 需要写入、重放或修改追踪文件的工作流——所有命令都是只读的。
  • 不使用上述三种受支持格式(网关导出、opencode 导出、AI SDK devtools 数据库)的追踪文件;未知格式会直接报错。
  • 想用图形界面深入探索的人可以由 agent 提示运行 view/devtools 可视化,但那不在本技能的 agent 命令范围内。

如何安装这个 Skill?

使用前请注意
  • 核心依赖 npx unbox-ai 来自未经验证的身份,首次运行会从 npm 拉取并执行代码,建议先审查该包或在受控环境中首次使用。
  • 本次为静态审查,未执行任何命令;技能的输出格式、错误行为和配方均未实际验证。
  • 技能缺少版本号与维护/更新说明,归属项目 unbox-ai 不在本仓库中,追踪上游变更需自行确认。
  • 分析对象是 AI 追踪文件,可能包含提示词、密钥或业务数据;-- 与 get 命令可输出未截断的原始内容,注意在共享环境中使用时的数据暴露。
  • 技能未说明中文界面或中文文档支持,且部分分析(如读取追踪内容)面向英文命令行输出。
开始前你需要
Agent 需要具备
  • Shell / 命令行
  • 网络访问
  • 本地文件系统
需要预先安装
  • Node.js
  • npx unbox-ai CLI
  • jq (for the analysis recipes)

该技能属于 tester-army/e2e 仓库中的 10 个技能合集(路径 .claude/skills/unbox-ai),源材料未提供单独的安装命令;CLI 本身通过 npx 调用:

npx unbox-ai

源材料未记录将技能目录复制到 Claude Code / Codex 的具体安装步骤,请参考该仓库的技能目录自行放置。

如何使用这个 Skill?

试试这样说

安装后,把下面任意一句发给 Agent 即可触发:

  • 帮我看看 runs/trace. 里这次 agent 运行为什么花了这么多 token,找出成本最高的 segment。
  • 检查 .devtools/generations.,agent 是不是卡在某个工具的重试循环里了?
  • 对比 run0. 和 run1. 这两次运行,告诉我它们从哪一步开始分歧。
  • 分析这个 opencode 会话导出的缓存命中率,值不值得改成单会话?

把追踪文件路径传给子命令即可,始终先广后深:summary 看全貌,tools 看工具统计,events 看每代指标,event <idx> 深挖单代,messages --grep 搜索消息,get 取精确原始值。多 run 来源先跑 runs,再用 --run <n> 圈定范围;被截断的输出会打印返回剩余内容的精确 get 调用,照着执行即可。bash
unbox-ai summary trace.
unbox-ai events trace. -- | jq '...'
unbox-ai compare a. b. --trajectory
对实时 devtools 数据库,先用 runs,再用 --run 跟进,索引是 run 本地的;标记 [live] 的 run 仍在执行,重跑命令可看到更新状态。

这个 Skill 有哪些优点和局限?

优点
  • 所有命令只读且输出有界,不会撑爆 agent 的上下文窗口。
  • 自动检测三种常见追踪格式,未知格式给出可读错误而非静默失败。
  • compare --trajectory 用 LCS 对齐工具序列,能直接指出两次运行从哪一步分歧。
  • 支持对正在写入的 devtools 数据库做中途实时分析,这在大多数工具里没有。
局限
  • 成本字段为 - 时(AI SDK devtools 追踪)无法给出美元金额,只能基于 token 推理。
  • jq 管道的分析配方需要用户环境装有 jq。
  • -- 输出无界,直接使用可能产生大量输出,需先看普通形式。
  • 源材料未提供该技能的独立安装文档或测试说明。

这个 Skill 与同类方案有什么区别?

与相关 Skills 并排比较;分数均按同一 FSRS 标准得出。

Skill FS 评分 Star 数 最近更新 License
unbox-ai — AI Agent 追踪分析 CLI 本页 54 · 谨慎使用 ★ 8.7k 1 天前 Apache-2.0
OpenCLI AutoFix 适配器自动修复技能 58 · 推荐 ★ 30k 17 天前 Apache-2.0
Agents Observe 54 · 谨慎使用 ★ 695 1 个月前 MIT
Playwright Trace CLI ✓ Microsoft · 官方 48 · 谨慎使用 ★ 97k 3 天前 Apache-2.0
BlockWatch 67 · 推荐 ★ 29 3 天前 MIT

源材料未直接点名竞品,但明确反对的替代做法是直接 cat/Read 原始追踪 JSON——追踪文件常有几兆字节的重复上下文,unbox-ai 的价值正在于用有界输出取代这种做法。

FollowSkills 如何评估这个 Skill?

FollowSkills 评估 · FSRS-2.0
谨慎使用
54/ 100 五分制 2.7 / 5
1信任安全14 / 25 · 2.8/5

技能声明所有命令只读且输出有界,并明确限制 view/devtools 等交互命令仅供人类使用,数据流透明度较高;但核心工具通过 npx unbox-ai 拉取,其源码不在本次证据中,依赖内容与供应链安全无法核实,也没有回滚或隔离说明,故未给高分。

2可靠稳定9 / 20 · 2.3/5

指令自洽、工作流清晰,错误行为有描述(未知文件报可读错误、非法正则回退字面量、指针机制),但静态审查无法执行验证,npx 包的可用性与实际输出格式未证实,失败反馈质量只能凭文档判断。

3适用触发11 / 15 · 3.7/5

触发条件在 description 中定义得相当精确(何时用、何时不用、支持三种格式并自动检测),受众与场景清晰,边界(仅支持列出的格式、cost 缺失时的退化处理)有说明;但未涉及中文支持,且格式之外的文件直接失败,兼容边界依赖文档自述。

4规范维护10 / 15 · 3.3/5

SKILL.md 分层良好:概览→命令→读数解释→分析配方→格式→在线调试,渐进披露到位,命名稳定;但技能本身无版本号、变更记录或维护责任声明,来源归属仅指向一个未在本仓库出现的 unbox-ai 项目,许可证对技能内容的适用性未明示。

5有效结果6 / 15 · 2.0/5

任务目标(不读原始 JSON 即可分析 agent 追踪)明确且有边际价值,配方直接给出可复制的 jq 管道;但输出正确性未经执行验证,且 npx 首次运行有下载成本,效益比例只能部分确认。

6证据核验4 / 10 · 2.0/5

证据仅限技能文档自述;仓库内的 CI、测试套件(benchmark、agent workflows)全部针对 e2e 框架而非 unbox-ai 技能本身,没有针对该技能关键路径的第三方执行证据,故上限受限。

1 2 3 4 5 6

点击维度查看打分理由

评估于 2026年10月10日 审查版本 449fa93670ee 评估证据[1][2][3][4][5][6][7][8][9][10]

证据充分度:低 — 主要依赖静态检查、作者材料或有限演示;适合发现线索,不适合做高风险决策。

查看完整评分方法 →

常见问题

读追踪文件会花很多 token 吗?
不会。所有命令输出有界,被截断时会打印能取回剩余内容的精确 get 调用,agent 按指针跟进而不是把整个文件读进上下文。
能不能边跑边分析?
可以,仅限用 @ai-sdk/devtools 埋点的项目:每条命令读取 .devtools/generations. 的最新快照,标 [live] 的 run 表示仍在执行,重跑命令即可看到新状态。
支持哪些追踪格式?
三种:网关导出({events[]})、opencode 会话导出({info, messages})、AI SDK devtools 数据库(.devtools/generations.)。summary 会打印识别到的格式,未知文件会以可读错误失败,不要换命令重试。
有风险吗?权限如何?
所有分析命令只读且输出有界,技能文档明确说明可以放心随意运行。view 和 devtools 可视化命令只应提供给人类用户,agent 自己不要使用。

同仓库的其他 Skills

均来自 tester-army/e2e

开发与工程

e2e Verify —— 端到端变更验证技能

用真实 CLI 对测试底座和基准应用跑真实验证,为每一处改动留下可看见的证据,而不是只说"编译通过了"。

★ 8.7k FS 64 推荐 1 天前
开发与工程

Ship a PR(e2e 仓库 PR 交付流程)

把 tester-army/e2e 仓库中已完成的工作,交付成一个人类无需对抗 CI 和机器人评论就能审查的 PR:跑检查、验证、新上下文自审、开 PR,并一路盯到打上 Ready for Human Review 标签。

★ 8.7k FS 59 推荐 1 天前
开发与工程

writing-pr:PR 标题与描述撰写规范

一套让审阅者第一屏就看懂变更形状的 PR 撰写规范:Conventional Commits 标题、证据驱动的正文和必填的本地验证章节。

★ 8.7k FS 58 推荐 1 天前
开发与工程

babysit — PR 自动值守技能

自动推动一个开放 PR 解决冲突、回复评审机器人、修复 CI,直到全绿并打上"Ready for Human Review"标签,把机器能清的障碍全部清完。

★ 8.7k FS 54 谨慎使用 1 天前
写作与内容

Unslop 文风去AI味技能

扫描并改写文本中的AI写作痕迹,同时注入真实的人类声音,让输出读起来像人写的。(description 中标注 Must always apply,即应始终生效。)

★ 8.7k FS 49 谨慎使用 1 天前
开发与工程

e2e Playground 验证技能

在声称 playground 改动可用之前,用 e2e 启动、驱动并截图取证验证 apps/testbed 测试应用。

★ 8.7k FS 59 推荐 1 天前
写作与内容

e2e 文档写作规范技能

为 e2e 文档站编写、精简和重构指南页面时,自动套用一套以读者浏览习惯为中心的写作与瘦身规范。

★ 8.7k FS 54 谨慎使用 1 天前
开发与工程

Create Verification Skill(e2e 验证技能生成器)

为你的项目自动生成一个 verify-<app> 验证技能,让任何编码智能体能像真实用户一样启动应用、驱动功能、留存证据并做 bug bash。

★ 8.7k FS 54 谨慎使用 1 天前
开发与工程

e2e 智能体端到端测试

用自然语言目标驱动浏览器与移动端 UI 测试,混合 agent 步骤与精确定位器断言,并带重放缓存降低模型成本。

★ 8.7k FS 52 谨慎使用 1 天前

相关 Skills