Harness — 智能体团队架构工厂
一句领域描述即可生成配套的专业智能体团队与技能,为 Claude Code 项目自动搭建可演进的自动化协作体系。
证据显示技能主要在项目内写文件(.claude/agents、.claude/skills、CLAUDE.md),无凭据窃取、隐蔽数据外传或恶意行为;Phase 0 要求审计后向用户报告并确认执行计划,工作区产物保留供审计,具备一定透明度。扣分点:无任何脚本/命令的权限声明或最小权限约束,生成的代理默认全工具访问并要求强制 model:"opus"(高成本),对 CLAUDE.md 的写入无回滚/恢复机制,用户确认仅在初始构建环节隐含,敏感数据处理未提及。
SKILL.md 与 6 个 references 内部自洽,模板、错误处理表、测试场景、工作流分支(新建/扩展/维护)齐备,Phase 选择矩阵逻辑清晰,故障路径(重试、缺漏明示、来源并记)有交代。扣分点:纯静态评审,无已提交的测试套件或 CI 证明关键路径可复现;生成的产物质量高度依赖模型行为,缺少对异常输入的具体失败反馈样例。
触发场景在 description 中明确列出(构建/扩展/审计/同步),非目标范围(.claude/commands 不生成)和模式选择边界有说明,用户熟手度自适应是加分项。扣分点:描述与全部正文为韩文,无中文/英文触发支持;核心功能完全依赖 Claude Code 实验性 agent teams 功能及 Anthropic 服务,对中国大陆网络可达性存在风险;成本极高(所有代理强制 opus)未在边界条件中声明。
Apache-2.0 许可明确,README 提供版本号(1.2.0)、多语言安装说明、结构图与 FAQ;skill 分层良好(SKILL.md + 6 个 references,含目录与渐进披露规范)。扣分点:skill 自身无 CHANGELOG 或版本记录,维护责任与更新路径未声明,发布者身份未验证;被引用的 references 均存在但 README 与 SKILL.md 间个别措辞(如小规模团队任务数)一致性未经校验。
README 提供作者自测的 A/B 数据(+60% 质量、15/15 胜率、n=15)并诚实标注为作者测量、第三方复现待定,且给出大量可复制的使用提示。扣分点:所有效力证据均为作者主张,静态评审无法验证生成产物可直接使用;+60% 的对比实验非独立可复现,边际价值与高 token 成本的性价比未充分论证。
存在可审计的一手材料:完整 SKILL.md、6 个 references、具体 bug 案例(SatangSlide 7 个边界 bug)与方法论,事实与推断基本分离,且 FAQ 主动披露证据局限。扣分点:无第三方复现、无已提交测试结果或 CI 工件,A/B 实验细节在姊妹仓库不可静态核验,证据类型单一(作者自述)。静态封顶 5 分,给 4 分。
- 本评审为纯静态源码评审,未执行任何测试;可靠性与效力分数受静态封顶约束。
- 生成的代理默认拥有全工具访问权限且强制使用 opus 模型,token 成本可能很高,建议使用前确认成本预算并审查生成的代理定义。
- 技能会修改项目 CLAUDE.md 并创建多个文件,建议先在版本控制下运行以便回滚。
- 核心功能依赖 Claude Code 实验性 agent teams 功能(CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1)及 Anthropic 服务,中国大陆网络可达性存在不确定性。
- 描述与正文均为韩文,非韩文用户触发与理解可能受限。
- +60% 质量提升为作者自测(n=15),无第三方复现,采纳决策请以自建试点数据为准。
- 发布者未经 FollowSkills 验证,身份不明。
这个 Skill 能做什么,适合哪些场景?
Harness 是一个 Claude Code 插件(也是元技能),能把你的领域描述转换为一支专业智能体团队及他们使用的技能。它从六种预定义的团队架构模式(流水线、扇出/扇入、专家池、生成-审校、监督者、层级委派)中选择合适模式,生成 .claude/agents/ 下的智能体定义和 .claude/skills/ 下的技能文件,并通过编排器技能把整个工作流串联起来。该体系设计为可演进的系统:每次执行后收集反馈,持续更新智能体、技能与 CLAUDE.md 变更记录。
触发后先审计项目中已有的 .claude/agents/、.claude/skills/ 和 CLAUDE.md,检测不一致(drift)并判断是新建、扩展还是维护模式;然后进行领域分析、选择执行模式(智能体团队为默认,备选子智能体或混合)和架构模式;生成智能体定义文件(强制要求文件化,含角色、原则、输入/输出协议、团队通信协议,统一使用 model: "opus");为每个智能体生成带渐进式披露结构的技能(SKILL.md 控制在 500 行内,细节移入 references/);生成编排器技能,明确数据传递协议(消息/任务/文件/返回值)、错误处理和 _workspace/ 中间产物管理;在 CLAUDE.md 中登记最小化的触发指针与变更历史;最后执行结构验证、触发验证(含 should-NOT-trigger 近失查询)和带技能/不带技能的对比测试。
- 研究型用户:需要一支能多角度调研、交叉验证并输出综合报告的智能体团队
- 全栈开发者:想为设计、前端(React/Next.js)、后端 API 和 QA 测试搭建从线框到部署的流水线式团队
- 内容创作者:为网漫制作或 YouTube 内容规划搭建编剧、角色设计、分镜、SEO 优化等协作角色
- 代码审查负责人:需要并行智能体分别检查架构、安全、性能和代码风格并汇总为一份报告
- 已有 Harness 体系的团队:做运行维护、智能体/技能同步、扩展或架构调整
- 技术写作者:从代码库自动生成带使用示例和完整性审校的 API 文档
这个 Skill 有哪些优点和局限?
- 六种成熟架构模式可供选择,覆盖顺序依赖、并行独立、生成-审校等常见协作形态
- 强制智能体定义文件化和 CLAUDE.md 变更历史,保证跨会话复用和可追溯性
- 内置 QA 方法论:with-skill vs without-skill 对比、触发验证、near-miss 查询、渐进式 QA
- 附带的作者实测 A/B 实验(n=15)显示平均质量分从 49.5 提升到 79.3,且诚实标注了数据局限
- 文档完善,README 有英/韩/日三语,references/ 含模板和真实团队配置示例
- 深度依赖 Claude Code 专属机制(TeamCreate、SendMessage、TaskCreate、Agent 工具、CLAUDE.md),无法直接移植到其他运行时
- 强制 model: "opus" 意味着较高的 API 成本,且文档未讨论成本权衡
- +60% 质量提升来自作者自测的 15 个任务,无第三方复现
- 需要开启实验性环境变量 CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1,特性可能变动
- 仓库未提供独立的自动化测试套件;主要验证依赖技能内置的运行时验证流程
如何安装这个 Skill?
方式一(市场安装):在 Claude Code 中运行 /plugin marketplace add revfactory/harness,然后 /plugin install harness@harness-marketplace。方式二(全局技能):执行 cp -r skills/harness ~/.claude/skills/harness。前置条件:需启用智能体团队实验特性,设置环境变量 CLAUDE_CODE_EXPERIMENTAL_AGENT_TEAMS=1。
如何使用这个 Skill?
在 Claude Code 会话中用自然语言触发,例如 "Build a harness for this project"、"Design an agent team for this domain"(中文可用 "하네스 구성해줘" 对应的中文类似表达可能不被官方列出,README 列出的是英文、韩文、日文触发语)。技能随后执行七阶段工作流:现状审计 → 领域分析 → 团队架构设计 → 智能体定义生成 → 技能生成 → 集成编排 → 验证测试,之后进入持续演进循环。
这个 Skill 与同类方案有什么区别?
README 明确对比了几个相邻项目:coleam00/Archon 是同一 L3 元工厂层的运行时配置工厂(适合确定性运行时配置),Harness 是团队架构工厂;SaehwanPark/meta-harness 是同一概念的 Codex 移植版;affaan-m/ECC 是跨 harness 的标准化层(不同层,可串联);wshobson/agents 是子智能体/技能目录,其条目可作为 Harness 生成团队中的零件。选择建议:要运行时确定性选 Archon,要团队架构选 Harness,Codex 环境选 meta-harness。