开发与工程 harness-engineeringcoding-agentsagents-mdverificationsession-handofffeature-trackingscaffoldingdeveloper-education

Harness Creator:AI 编码代理线束工程构建器

当编码代理跨会话失忆、越界、谎报"已完成"时,用它搭建、审计并改进让代理可靠工作的线束(harness)。

FollowSkills 评估 · FSRS-2.0
谨慎使用
56/ 100 五分制 2.8 / 5
1 2 3 4 5 6
1信任安全16 / 25 · 3.2/5

SKILL.md 明确要求覆盖前获得用户确认、最小化收集上下文、禁止隐藏破坏性行为,设计规则层面对安全有明确约束;但捆绑脚本 create-harness.mjs 等源码未在本次评审材料中呈现,无法静态核实其实际行为与最小权限,扣分。

2可靠稳定9 / 20 · 2.3/5

指令自洽,README 声称脚本仅用 Node 内置模块且含 10 个 eval 用例,声明了 benchmark 自检机制;但脚本源码不可见,无 CI 执行 eval 的证据,异常输入的失败反馈质量无法静态核实,按锚点上限不超过 10,扣分。

3适用触发11 / 15 · 3.7/5

受众与场景清晰(跨会话不可靠的编码代理),明确列出非适用范围,触发词丰富,metadata 声明支持中文;但核心功能依赖 npx/GitHub 安装路径,未提供面向中国大陆网络可达性的说明,边界与触发条件的实际精度证据有限,扣分。

4规范维护10 / 15 · 3.3/5

文档分层良好(SKILL.md + references + evals + README 双语),有版本号、MIT 许可证、metadata. 与明确的文件结构;但维护者责任与更新路径不明确,发布方未经验证,changelog 缺失,扣分。

5有效结果6 / 15 · 2.0/5

五子系统模型清晰、交付清单具体,声称 benchmark 自检验证脚本端到端可用,并诚实声明结构性评分不能替代真实前后对比测试;但静态评审无法核实输出直接可用性,比较收益证据仅为转述第三方实验,扣分。

6证据核验4 / 10 · 2.0/5

提供了 evals.、schema 模板与自检式 benchmark 设计,属于可审计的一手材料;但无第三方执行证据,无 CI 运行 eval 的可复现链路,引用文献未链接原始出处,静态上限 5,扣分。

证据充分度: 评估于 2026年9月9日 审查版本 77e7a3e21469
使用前请注意
  • 捆绑脚本源码未在本次评审范围内可见,建议使用前人工审查 create-harness.mjs 等脚本,尤其是 --force 覆盖行为。
  • 结构化评分与自检 benchmark 不等于真实有效性,重要项目请自行做前后代理会话对比。
  • 安装依赖 npx 与 GitHub,中国大陆网络环境下可能需要镜像或手动复制目录。
  • 发布方身份未经验证,维护与更新承诺无外部背书,建议锁定版本后使用。
  • 元数据声明支持中文,但技能正文为英文,中文支持程度有限。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

harness-creator 是 walkinglabs/learn-harness-engineering 课程仓库附带的可复用技能,用于为 AI 编码代理搭建可靠的运行环境。它围绕五个子系统组织:指令文件(AGENTS.md/CLAUDE.md)、状态(feature_list.、progress.md)、验证(init.sh 及可运行命令)、范围(功能依赖与完成标准)和会话生命周期(session-handoff.md)。技能附带三个 Node.js 脚本,可在本地仓库上一键创建线束、审计现有线束并生成 HTML 评估报告。它适用于代理在长任务中不稳定、遗忘上下文或每次会话启动方式不一致的场景。

技能做三件具体的事:(1) 用 create-harness.mjs 脚本在目标项目生成最小线束文件(AGENTS.md 或 CLAUDE.md、feature_list.、progress.md、init.sh、可选 session-handoff.md);(2) 用 validate-harness.mjs 对现有仓库按五个子系统打分,报告最低分项和前 2-3 个改进建议;(3) 用 render-assessment-html.mjs 和 run-benchmark.mjs 生成可分享的 HTML 结构化评估报告,基准会先自检(脚手架一个临时线束并验证)再对目标打分。脚本支持 --agent-file、--package-manager、--commands、--force 等选项。另有七份参考文档覆盖记忆持久化、工具安全、上下文预算、多代理协调等主题,按需加载。

  1. 在真实项目中使用 Claude Code 或 Codex 的工程师,发现代理每次会话都从头开始、忘记之前的进度,需要持久化状态和交接机制。
  2. 维护一个已有 AGENTS.md 但代理仍频繁越界或提前宣布完成的老仓库,想用审计脚本找出五个子系统中的瓶颈。
  3. 技术负责人想在团队内推广统一的代理工作区结构,需要可分享的 HTML 评估报告作为讨论基础。
  4. 刚开始接触线束工程的新手,想通过运行课程项目(同一 Electron 知识库应用的七个渐进实验)从零理解环境设计如何影响代理可靠性。
  5. 想把静态提示词升级为自动化循环(目标循环、定时循环、maker-checker 分离)的中级用户,参考 L13 讲义和 P07 项目模板。

这个 Skill 有哪些优点和局限?

优点
  • 理论源自 OpenAI 和 Anthropic 的工程实践文章,并有同仓库 13 讲义 + 7 项目的完整课程支撑
  • 提供开箱即用的 Node.js 脚本,创建、审计、报告三个动作都能一行命令完成
  • 审计输出最低分子系统评分和具体前几项改进,而不是泛泛的评分
  • 设计规则明确要求验证证据和显式确认才允许覆盖文件,安全性考虑周到
  • 课程内容翻译成 15 种语言,另有零依赖的 shell 审计脚本 audit-harness.sh
局限
  • 基准报告仅是结构化评估,真实有效性需要在不同任务上做前后代理会话对比,仓库本身未提供这些数据
  • 创建脚本依赖 Node.js 运行环境(虽然 tools/ 下有零依赖 shell 备选)
  • 课程正文中的代码片段(如 init.sh)是概念模板,落地到具体技术栈仍需自行调整
  • SKILL.md 未声明具体测试套件,脚本的跨平台行为未在源材料中验证
  • source material 未展示在任何特定平台上的实测记录;实际效果取决于所用代理对指令文件的遵循程度

如何安装这个 Skill?

将 skills/harness-creator/ 文件夹安装到你的代理技能目录(例如 Claude Code 的技能目录)。课程本体无需安装即可阅读,本地预览需 git clone 仓库后运行 npm install && npm run docs:dev。

如何使用这个 Skill?

创建线束:node skills/harness-creator/scripts/create-harness.mjs --target /path/to/project(可加 --agent-file CLAUDE.md、--package-manager npm|pnpm|yarn|bun、--commands "cmd one,cmd two"、--force)。审计:node skills/harness-creator/scripts/validate-harness.mjs --target /path/to/project。报告:node skills/harness-creator/scripts/render-assessment-html.mjs --target /path/to/project,或 run-benchmark.mjs --target ... --html report.html。也可以直接用自然语言触发技能,例如"帮我给这个仓库搭一个最小线束"——即使你没提到"harness"这个词。

这个 Skill 与同类方案有什么区别?

源材料将本仓库与 Awesome Harness Engineering 列表及 OpenAI/Anthropic 的线束工程文章并列为参考来源;同团队的兄弟课程包括 Hands-on Modern RL 和 Modern LLM Notebook,但领域不同,不构成竞争替代。

常见问题

用这个技能要花多少钱?
技能本身是 MIT 许可、免费开源。间接成本来自运行编码代理本身——课程引用的 Anthropic 实验显示,带完整线束的 Opus 4.5 六小时花费约 200 美元,而无线束时 20 分钟花了 9 美元但产出的东西不可用。
脚本会不会覆盖我现有的文件?
默认不会。SKILL.md 明确要求 --force 只在确认覆盖可接受后使用,并规定"绝不在脚本中隐藏破坏性行为;覆盖需要用户显式批准"。
我不用 Claude,只用 Codex 或其他代理可以吗?
可以。技能生成的文件是平台无关的(AGENTS.md/CLAUDE.md 二选一、JSON 状态文件、shell 脚本),任何能读写文件和执行命令的编码代理都能使用;创建脚本还支持 --agent-file 指定面向特定代理的指令文件名。
审计分数高就代表代理一定会表现好吗?
不一定。技能自身强调基准只是结构性评估,它先自检证明脚本可用,再对目标打分;真实有效性需要在代表性任务上做前后代理会话对比,审计结果应结合失败记录和任务结果确认因果。

相关 Skills