Harness Creator:AI 编码代理线束工程构建器
当编码代理跨会话失忆、越界、谎报"已完成"时,用它搭建、审计并改进让代理可靠工作的线束(harness)。
SKILL.md 明确要求覆盖前获得用户确认、最小化收集上下文、禁止隐藏破坏性行为,设计规则层面对安全有明确约束;但捆绑脚本 create-harness.mjs 等源码未在本次评审材料中呈现,无法静态核实其实际行为与最小权限,扣分。
指令自洽,README 声称脚本仅用 Node 内置模块且含 10 个 eval 用例,声明了 benchmark 自检机制;但脚本源码不可见,无 CI 执行 eval 的证据,异常输入的失败反馈质量无法静态核实,按锚点上限不超过 10,扣分。
受众与场景清晰(跨会话不可靠的编码代理),明确列出非适用范围,触发词丰富,metadata 声明支持中文;但核心功能依赖 npx/GitHub 安装路径,未提供面向中国大陆网络可达性的说明,边界与触发条件的实际精度证据有限,扣分。
文档分层良好(SKILL.md + references + evals + README 双语),有版本号、MIT 许可证、metadata. 与明确的文件结构;但维护者责任与更新路径不明确,发布方未经验证,changelog 缺失,扣分。
五子系统模型清晰、交付清单具体,声称 benchmark 自检验证脚本端到端可用,并诚实声明结构性评分不能替代真实前后对比测试;但静态评审无法核实输出直接可用性,比较收益证据仅为转述第三方实验,扣分。
提供了 evals.、schema 模板与自检式 benchmark 设计,属于可审计的一手材料;但无第三方执行证据,无 CI 运行 eval 的可复现链路,引用文献未链接原始出处,静态上限 5,扣分。
- 捆绑脚本源码未在本次评审范围内可见,建议使用前人工审查 create-harness.mjs 等脚本,尤其是 --force 覆盖行为。
- 结构化评分与自检 benchmark 不等于真实有效性,重要项目请自行做前后代理会话对比。
- 安装依赖 npx 与 GitHub,中国大陆网络环境下可能需要镜像或手动复制目录。
- 发布方身份未经验证,维护与更新承诺无外部背书,建议锁定版本后使用。
- 元数据声明支持中文,但技能正文为英文,中文支持程度有限。
这个 Skill 能做什么,适合哪些场景?
harness-creator 是 walkinglabs/learn-harness-engineering 课程仓库附带的可复用技能,用于为 AI 编码代理搭建可靠的运行环境。它围绕五个子系统组织:指令文件(AGENTS.md/CLAUDE.md)、状态(feature_list.、progress.md)、验证(init.sh 及可运行命令)、范围(功能依赖与完成标准)和会话生命周期(session-handoff.md)。技能附带三个 Node.js 脚本,可在本地仓库上一键创建线束、审计现有线束并生成 HTML 评估报告。它适用于代理在长任务中不稳定、遗忘上下文或每次会话启动方式不一致的场景。
技能做三件具体的事:(1) 用 create-harness.mjs 脚本在目标项目生成最小线束文件(AGENTS.md 或 CLAUDE.md、feature_list.、progress.md、init.sh、可选 session-handoff.md);(2) 用 validate-harness.mjs 对现有仓库按五个子系统打分,报告最低分项和前 2-3 个改进建议;(3) 用 render-assessment-html.mjs 和 run-benchmark.mjs 生成可分享的 HTML 结构化评估报告,基准会先自检(脚手架一个临时线束并验证)再对目标打分。脚本支持 --agent-file、--package-manager、--commands、--force 等选项。另有七份参考文档覆盖记忆持久化、工具安全、上下文预算、多代理协调等主题,按需加载。
- 在真实项目中使用 Claude Code 或 Codex 的工程师,发现代理每次会话都从头开始、忘记之前的进度,需要持久化状态和交接机制。
- 维护一个已有 AGENTS.md 但代理仍频繁越界或提前宣布完成的老仓库,想用审计脚本找出五个子系统中的瓶颈。
- 技术负责人想在团队内推广统一的代理工作区结构,需要可分享的 HTML 评估报告作为讨论基础。
- 刚开始接触线束工程的新手,想通过运行课程项目(同一 Electron 知识库应用的七个渐进实验)从零理解环境设计如何影响代理可靠性。
- 想把静态提示词升级为自动化循环(目标循环、定时循环、maker-checker 分离)的中级用户,参考 L13 讲义和 P07 项目模板。
这个 Skill 有哪些优点和局限?
- 理论源自 OpenAI 和 Anthropic 的工程实践文章,并有同仓库 13 讲义 + 7 项目的完整课程支撑
- 提供开箱即用的 Node.js 脚本,创建、审计、报告三个动作都能一行命令完成
- 审计输出最低分子系统评分和具体前几项改进,而不是泛泛的评分
- 设计规则明确要求验证证据和显式确认才允许覆盖文件,安全性考虑周到
- 课程内容翻译成 15 种语言,另有零依赖的 shell 审计脚本 audit-harness.sh
- 基准报告仅是结构化评估,真实有效性需要在不同任务上做前后代理会话对比,仓库本身未提供这些数据
- 创建脚本依赖 Node.js 运行环境(虽然 tools/ 下有零依赖 shell 备选)
- 课程正文中的代码片段(如 init.sh)是概念模板,落地到具体技术栈仍需自行调整
- SKILL.md 未声明具体测试套件,脚本的跨平台行为未在源材料中验证
- source material 未展示在任何特定平台上的实测记录;实际效果取决于所用代理对指令文件的遵循程度
如何安装这个 Skill?
将 skills/harness-creator/ 文件夹安装到你的代理技能目录(例如 Claude Code 的技能目录)。课程本体无需安装即可阅读,本地预览需 git clone 仓库后运行 npm install && npm run docs:dev。
如何使用这个 Skill?
创建线束:node skills/harness-creator/scripts/create-harness.mjs --target /path/to/project(可加 --agent-file CLAUDE.md、--package-manager npm|pnpm|yarn|bun、--commands "cmd one,cmd two"、--force)。审计:node skills/harness-creator/scripts/validate-harness.mjs --target /path/to/project。报告:node skills/harness-creator/scripts/render-assessment-html.mjs --target /path/to/project,或 run-benchmark.mjs --target ... --html report.html。也可以直接用自然语言触发技能,例如"帮我给这个仓库搭一个最小线束"——即使你没提到"harness"这个词。
这个 Skill 与同类方案有什么区别?
源材料将本仓库与 Awesome Harness Engineering 列表及 OpenAI/Anthropic 的线束工程文章并列为参考来源;同团队的兄弟课程包括 Hands-on Modern RL 和 Modern LLM Notebook,但领域不同,不构成竞争替代。