开发与工程 eval-frameworkbenchmarkingdockeropenroutermcpclitool-callinggrader

skill-optimizer:Agent Skill 评估工作台

在隔离的 Docker 工作区内运行确定性评估,对 Agent Skill 做基准测试、调试与优化,并通过 OpenRouter 验证跨模型表现。

FollowSkills 评估 · FSRS-2.0
推荐
61/ 100 五分制 3.1 / 5
1 2 3 4 5 6
1信任安全17 / 25 · 3.4/5

证据显示代理阶段仅挂载 /work,无 /case、/results、Docker socket,env 走显式白名单并校验变量名,隐藏答案与 graders 隔离,且明确提示转发凭据可被代理读取、要求使用最小权限测试账号并视 trace/workspace 为敏感——数据流披露充分。扣分项:env 变量原样转发进代理容器本身仍是实际暴露面,无用户级确认或回滚机制,发布者身份未经注册处验证。未满分的原因为权限、确认与恢复链条不完整。

2可靠稳定12 / 20 · 3.0/5

仓库包含大量针对性冒烟测试(case 加载、grader 归一化、超时语义、MCP 校验、分发元数据)和 CI workflow(node 20/22 矩阵运行 typecheck+test+build),文档对命令行为、失败输出(trace.l、result.、workspace 保留)描述自洽且可诊断。扣分项:静态审阅无法执行,真实模型运行依赖 OpenRouter 与 Docker 环境可用性,未在本次证据内验证;核心 eval 路径的端到端复现未证实。

3适用触发9 / 15 · 3.0/5

场景与受众清晰(为 agent skill 编写/调试评测),边界明确(仅限可本地确定性判分的任务、仅支持 openrouter/ 模型、不支持 OAuth),触发描述具体。扣分项:核心功能完全依赖 OpenRouter(海外服务,中国大陆可达性存疑)与本地 Docker;无中文支持;非适用范围声明虽然存在但示例覆盖有限。

4规范维护11 / 15 · 3.7/5

文档分层良好(SKILL.md 概览 + references/workbench.md 详解 + examples),有 MIT 许可、package. 版本 2.0.0、CHANGELOG.md 列入 files,测试锁定插件元数据与文档一致性,开发检查清单明确。扣分项:作者字段为 'Fast' 而版权为 Pi Squared Inc.,归属与维护责任不完全一致;发布者未经验证;无可见的更新路径承诺。

5有效结果6 / 15 · 2.0/5

声称的产出(可运行的评测工作台、可复用 SDK/CLI、确定性判分)与文档和示例结构一致,相比手动搭建 eval 有明确边际价值,示例命令具体。扣分项:静态审阅无法验证输出可直接使用,未提供已验证的代表性结果证据,成本收益未量化。

6证据核验6 / 10 · 3.0/5

存在真实 CI workflow 与覆盖关键路径(case 加载、grader 运行、分发元数据)的已提交测试套件,且测试直接校验 SKILL.md 与参考文档内容一致性,可审计性强。扣分项:静态审阅不能独立复现 CI 结果,模型端到端行为无第三方佐证,不能给更高分。

证据充分度: 评估于 2026年9月10日 审查版本 eeb37df98b70
使用前请注意
  • 核心功能完全依赖 OpenRouter API 与本地 Docker;中国大陆网络对 OpenRouter 的可达性不确定,使用前请自行验证。
  • env 白名单中的凭据会被原样转发进代理容器,代理可经 shell 工具读取并打印;务必使用专用最小权限测试账号,并将 trace.l、result.、workspace 视为可能含密文的敏感数据。
  • package. 作者为 'Fast',许可证版权为 Pi Squared Inc.,发布者未经 FollowSkills 注册处验证;供企业采购时注意归属与维护责任的核实。
  • 仅支持 openrouter/ 模型引用且不支持 OAuth/browser 认证,集成范围有限;本文为静态审阅,未执行任何命令,所有分数置信度低。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

skill-optimizer 是一个面向 Agent Skill 的评估工作台,随 fastxyz/skill-optimizer 仓库以 MIT 许可发布。它让模型在隔离的 Docker /work 目录中完成任务,把待测技能作为普通工作区文件提供,记录完整的 agent 轨迹,再用确定性的本地评分器判定成败。用例(case)与 OpenRouter 模型组成矩阵化的套件(suite),支持多次试验。它同时是一个可安装到 Claude Code、Codex、Cursor、OpenCode、Gemini 等代理的技能/插件,教会你的代理如何编写和调试评估套件。评估结果以 JSON 文件和 trace.l 形式落地,构成可复现的优化闭环。

读取 suite.yml / case.yml 中定义的任务、模型矩阵、环境变量与 setup 命令;将 references/ 与 workspace/ 复制进 Docker 容器的 /work;通过 OpenRouter 调用模型(仅支持 openrouter/... 引用,需 OPENROUTER_API_KEY);运行 agent 阶段并捕获 trace.l(含消息与工具调用),期间 agent 无法看到评分器与隐藏答案;可选择启动 MCP 服务器(含对 agent 隐藏的 Docker 服务型 MCP);agent 结束后在挂载 /case、/work、/results 的环境中执行确定性 shell 评分器,输出 pass/score/evidence;结果写入 .results/<run-id>/ 下的 suite-result.、result.、summary.、trace.l 等。另导出 loadWorkbenchCase、runWorkbenchSuite 等 SDK 函数供编程调用。

  1. 技能作者想在新版本上线前,验证自己的 Skill 在 Gemini、GPT 等多个模型上都能稳定完成任务
  2. 团队需要回归测试:修改技能文档或参考材料后,重跑同一套 case 确认没有引入退化
  3. 开发者想测试 agent 是否正确调用 MCP 工具,包括源码对 agent 隐藏的本地 MCP 服务
  4. 安全导向的用户想评估 agent 对'不应使用工具'的控制类任务,以及是否误读了无关技能文件
  5. 集成验证场景:需要通过真实 CLI/API/服务的确定性产物(生成文件、命令日志、answer.)判定成败,而非主观判断

这个 Skill 有哪些优点和局限?

优点
  • 评分确定且本地化:默认不用 LLM 评判,结果可复现、可回归
  • 隔离性好:agent 只见 /work,看不到评分器、隐藏答案和 /case,避免评测泄漏
  • 多模型矩阵与多次试验内建,OpenRouter 一个 key 即可跨厂商测
  • 支持 MCP 工具评估,含源码对 agent 隐藏的服务型 MCP
  • 同时提供 CLI 与 SDK,且有 PDF 与 MCP 两个完整示例套件可直接跑
局限
  • 仅支持 openrouter/... 模型引用,不能直连其他厂商 API
  • 运行依赖 Docker 与 Node.js 20+,真实模型调用必须有 OPENROUTER_API_KEY,产生 token 费用
  • MCP 不支持 OAuth/浏览器认证,只能用 env/header 凭据;远程服务器需 Docker 可达
  • env 中的凭据会被 agent 通过 shell 访问,trace 与 workspace 可能含敏感值,需谨慎处理
  • 源材料未说明测试覆盖率或对 Claude Code 之外的代理运行时的实测情况

如何安装这个 Skill?

完整安装需本地环境:Node.js 20+、Docker,并设置 OPENROUTER_API_KEY。克隆仓库后执行 npm install && npm run build。若只要把技能装进代理,运行:npx skills add fastxyz/skill-optimizer --skill skill-optimizer -a claude-code -a opencode -a codex -a cursor -y。Claude Code 也可用 /plugin marketplace add fastxyz/skill-optimizer/plugin install skill-optimizer@skill-optimizer;Gemini CLI 用 gemini extensions install https://github.com/fastxyz/skill-optimizer。注意:仓库捆绑了 2 个技能,本配置只描述 skills/skill-optimizer/SKILL.md 这一个。

如何使用这个 Skill?

编写套件:创建 suite.yml(含 models、env、setup、cases 与 graders),把待测技能放到 references/ 下,setup 与评分脚本放 checks/,假 CLI 放 bin/。运行:npx tsx src/cli.ts run-suite examples/workbench/pdf/suite.yml --trials 1,或单 case:npx tsx src/cli.ts run-case <case.yml> --model openrouter/google/gemini-2.5-flash。run-suite 使用 suite.yml 中的 models,不支持模型覆盖参数。调试时查看失败 trial 的 result.、summary.、trace.l 和保留的 workspace/,先归类失败原因(技能指引不清、参考缺失、评分器脆弱、输入不真实、任务歧义、代码 bug),再针对性修改并重跑验证。

这个 Skill 与同类方案有什么区别?

源材料未点名具体竞品,但从定位看,它填补的是'针对 Agent Skill 而非模型本身'的评估空白:通用 LLM 评测框架通常不含 Docker 工作区与技能文件注入,而本工具把待测技能作为工作区文件交给 agent,再用确定性评分器验收,因而更适合技能迭代场景。

常见问题

需要付费吗?
代码本身 MIT 免费,但真实模型运行通过 OpenRouter 调用,需自备 OPENROUTER_API_KEY 并承担相应 token 费用;本地 Docker 执行免费。
评分器必须用 LLM 评判吗?
不。评分器是 shell 命令,检查 /work 中的文件、trace.l 等本地证据;除非评估明确要求,官方建议保持确定性、避免 LLM 评判。
能测哪些模型?
只能用 openrouter/... 前缀的模型引用(如 openrouter/google/gemini-2.5-flash),不直接支持其他厂商 API。
凭据安全怎么处理?
env 变量会原样传入各阶段容器,agent 可通过 shell 读取;官方建议为线上集成评估使用专用测试账号和最小权限凭据,并把 trace、workspace 输出视为可能含敏感信息。

同仓库的其他 Skills

均来自 fastxyz/skill-optimizer

相关 Skills