开发与工程 skill-authoringtest-driven-developmentprocess-documentationagent-evaluationyaml-frontmattersubagent-testing

技能写作测试框架

用测试驱动方法创建、修改并验证 Agent Skills。

FollowSkills 评估 · FSRS-2.0
不推荐
44/ 100 五分制 2.2 / 5
1 2 3 4 5 6
1信任安全12 / 25 · 2.4/5

技能内容主要是文档编写与测试方法,没有要求凭据、敏感数据或高权限操作,也未见恶意外传或破坏性默认行为;但强制性措辞、删除先前代码的建议缺少用户确认、回滚和数据流说明,发布者身份也未验证,因此未接近满分。

2可靠稳定6 / 20 · 1.5/5

结构化的 RED-GREEN-REFACTOR 流程、场景分类和失败反馈较清晰;但本次提供的 SKILL.md 在部署清单的 GREEN 阶段中断,依赖未在该技能内完整定义的 test-driven-development、子代理及外部参考,静态材料不足以证明关键路径可复现,因此扣分。

3适用触发8 / 15 · 2.7/5

目标受众和主要场景(创建、编辑、验证 agent skills)明确,包含纪律型、技术型、模式型和参考型技能的区分;但触发描述较宽泛,非适用边界、输入输出契约、中文使用和中国大陆网络可达性均未充分说明,且核心测试依赖特定代理运行环境,因此扣分。

4规范维护8 / 15 · 2.7/5

信息架构、渐进式披露、命名、示例、反模式和引用文件组织较完整;仓库提供 MIT 许可、版本号和维护/贡献线索,但技能本身缺少明确维护责任人、变更日志、稳定版本策略和依赖安装说明,且部分外部引用不可由本次材料独立核验,因此扣分。

5有效结果6 / 15 · 2.0/5

文档提供了较具体的测试场景、压力类型、失败分类和迭代方法,理论上可直接指导技能作者;但静态审查不能确认代理实际遵循这些流程,且依赖子代理、运行时技能目录和测试 harness,输出成果仍需人工判断,因此按静态上限保守扣分。

6证据核验4 / 10 · 2.0/5

存在提交的测试相关脚本、示例场景和方法论材料,提供一定审计线索;但未提供覆盖 writing-skills 关键路径的真实执行结果或完整测试报告,研究与最终合规率声明也无法仅凭给定文件独立复现,因此未超过静态证据上限。

证据充分度: 评估于 2026年7月19日 审查版本 d884ae04edeb
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 该评估仅基于给定源文件,未执行脚本、测试或子代理场景。
  • 部署清单在提供的 SKILL.md 中途截断,不能确认完整流程、失败处理和回滚要求。
  • 使用前应确认 superpowers:test-driven-development、子代理能力、运行时技能目录和测试 harness 均可用,并明确删除或重写现有内容前的用户确认与备份策略。
  • 核心文档和示例主要面向英语及特定代理生态,中文团队可能需要本地化触发词、示例和环境说明。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 Superpowers 仓库中的一个元技能,专门指导 Agent 创建、编辑和部署前验证其他技能。它把测试驱动开发的 RED-GREEN-REFACTOR 周期应用到流程文档:先用压力场景观察没有技能时的失败,再编写最小文档并重新测试。内容覆盖技能结构、发现优化、交叉引用、示例、反模式和部署检查。使用前必须理解 superpowers:test-driven-development。

指导 Agent 在写技能前创建由子 Agent 执行的压力场景,并记录未加载技能时的基线行为和合理化借口;指导其编写包含 YAML name 与 description 前置字段的 SKILL.md,检查触发描述、关键词、结构、示例和文件组织;要求加载新技能后重新运行场景,识别新的漏洞并迭代修正;还建议用 wc -w 检查篇幅,并在存在图表时使用仓库提供的 render-graphs.js 渲染流程图。

  1. 维护 Superpowers 或其他 Agent Skills 仓库、需要新增可复用技能时
  2. 修改现有技能规则、担心 Agent 在压力下绕过要求时
  3. 部署技能前,需要用压力场景验证 Agent 是否真正遵守文档时
  4. 编写包含触发描述、交叉引用、示例和检查清单的标准化 SKILL.md 时

这个 Skill 有哪些优点和局限?

优点
  • 提供从基线失败到验证通过再到闭环修正的完整流程
  • 明确要求记录 Agent 的实际合理化借口,而不是只做文档审阅
  • 覆盖前置字段、发现优化、文件组织、反模式和部署检查
  • 适用于新技能和现有技能修改
局限
  • 依赖对 superpowers:test-driven-development 的理解
  • 压力场景和微测试可能耗时且成本较高,文档明确称完整场景运行较慢且昂贵
  • 未提供本技能独立测试命令;仓库另行说明技能行为测试使用 superpowers-evals 的 drill harness
  • 技能本身主要提供流程文档,不是独立的自动化执行工具

如何安装这个 Skill?

该仓库将 14 个技能打包在一起,README 提供的是整个 Superpowers 集合的安装方式,而非本技能的独立安装命令。根据 SKILL.md 的说明,将 skills/writing-skills/ 放入运行时的 skills 目录;具体目录位置取决于所使用的 Agent harness。README 明确记录了整套集合在 Claude Code、Codex App、Codex CLI、Cursor、OpenCode、Pi 等环境中的安装方式。

如何使用这个 Skill?

在创建、编辑或部署前验证技能时触发,例如:"Create a new skill for handling database migrations and verify it before deployment." 先运行不加载目标技能的基线压力场景,再编写或修改 SKILL.md,随后加载技能重复测试并修复发现的合理化漏洞。使用该技能前,先理解 superpowers:test-driven-development。

这个 Skill 与同类方案有什么区别?

它明确把技能创作与测试驱动开发对应起来:压力场景对应测试用例,SKILL.md 对应生产代码,未加载技能时的违规对应 RED,加载后合规对应 GREEN,修补合理化漏洞对应 REFACTOR。

常见问题

它是一个可以单独运行的程序吗?
不是。它是一个 SKILL.md 指南,指导 Agent 设计测试场景、编写技能文档并验证行为。
是否必须使用子 Agent?
该技能将压力场景定义为由子 Agent 执行的测试方式,并要求在基线和加载技能后进行验证。
它适合一次性项目说明文档吗?
不适合。指南建议技能应是可复用、跨项目的技术或模式;一次性方案和项目专属约定不应创建为技能。
使用它是否需要网络或 MCP?
提供的内容没有显示 MCP 依赖或必需的网络调用;它涉及本地技能文件、Shell 命令以及可选的 Git 提交和推送流程。

同仓库的其他 Skills

均来自 obra/superpowers

相关 Skills