自主智能体控制台
为自主智能体设计可控、可恢复、可审计的运行框架。
技能明确区分锁定、可编辑、追加写入和人工控制表面,要求回滚、持久化日志及合并/部署的人审,体现了权限边界与外部影响控制。未说明敏感数据处理、凭据隔离、依赖安全、数据流披露或通用恢复方案,因此扣分。
正文结构一致,涵盖保持、丢弃、崩溃、超时和审查状态,并给出循环与检查清单。技能本身没有可执行脚本、测试或具体异常输入/失败消息示例,关键路径无法静态复现,因此按静态上限保守扣分。
触发场景具体,并明确排除 evaluation、tool-design、project-development 和 hosted-agents 等相邻范围;同时覆盖研究、实验、PR 和后台代理。未定义标准输入输出、更多非适用边界、中文使用方式或中国大陆网络环境适配,因此扣分。
信息架构清晰,具备概念、详细主题、实践清单、文件布局、示例、陷阱和集成说明;仓库提供 MIT 许可,技能含创建时间、更新时间、作者和版本。缺少本技能专属变更记录、维护责任人和明确更新路径,内部参考文件也未随本次证据提供,因此扣分。
锁定评估器、窄化编辑面、耐久日志、创新门和人工审批等建议可直接转化为设计决策,且示例覆盖典型 harness 模式。输出主要是概念指导而非可运行实现,引用的内部运行手册未提供,仍需较多工程适配与验证,因此未超过静态上限并扣分。
技能列出了 Karpathy autoresearch、Prime Intellect、AlphaEvolve、FunSearch、HELM 和 LM Evaluation Harness 等参考方向,具备一定追溯线索。未提供具体链接、引用定位、提交测试或针对本技能关键路径的验证证据,且本次未执行任何内容,因此仅给有限分数。
- 这是仅基于静态文件的低置信度评估,未执行任何脚本、测试或示例。
- 实施时应补充凭据/敏感数据隔离、网络与文件权限、超时和崩溃恢复、回滚边界及用户确认规则。
- 外部资源和内部参考文件未在本次材料中得到逐项验证;不要将文档中的研究或仓库级 CI 声明视为本技能已通过运行验证。
这个 Skill 能做什么,适合哪些场景?
Harness Engineering 用于设计围绕智能体运行的控制系统,明确其可编辑范围、反馈机制、状态持久化和审批边界。它覆盖研究循环、评估脚手架、锁定与可编辑表面、持久化日志、新颖性门控、剪枝、回滚和 PR 准备。该技能特别适合需要长时间自主运行、但仍要求防止指标作弊和未经授权操作的系统。仓库采用 MIT 许可证,并将此技能作为 23 个独立技能之一提供。
指导用户划分锁定、可编辑、只追加和人工控制的工作表面;设计带有评估、保留或丢弃、崩溃、超时、回滚和人工复核状态的循环;将计划、来源队列、结果、失败记录和交接信息写入文件;为研究转技能流程加入来源检索、新颖性检查、机制注册表和剪枝规则;设计监控报告与自动生成 PR 但不自动合并的治理流程。
- 研究团队构建会持续检索来源、评估候选方案并提出技能变更的自主研究循环。
- 工程团队让智能体优化代码或提示词,同时锁定评估脚本和指标,避免智能体修改基准。
- 平台团队运行会持续数小时或数天的后台智能体,并需要通过线程日志和结果文件恢复状态。
- 维护者希望智能体准备 PR、运行检查并生成摘要,但将合并、部署和破坏性操作保留给人工审批。
- 系统设计者需要检测重复机制、保存失败尝试,并通过剪枝控制自主实验堆栈的复杂度。
这个 Skill 有哪些优点和局限?
- 明确区分智能体可修改内容与必须锁定或人工控制的表面。
- 覆盖持久化日志、失败记录、回滚、新颖性检查和剪枝等长时运行机制。
- 提供自动实验循环、研究转技能循环和自动 PR 准备的具体流程。
- 强调来源检索证据、逐维度评分和人工审批,针对指标作弊给出防护措施。
- 它主要提供设计原则、流程和伪代码;该技能目录内容未提供可直接运行的实现脚本。
- 未看到针对特定客户端、部署环境或运行时的完整配置示例。
- 技能本身未展示独立测试套件或实测性能数据,采用前仍需在目标环境验证。
- 虽然涉及来源刷新和文件状态管理,但具体网络服务、存储后端和权限模型未被规定。
如何安装这个 Skill?
将仓库作为插件目录添加,或复制该技能目录到项目的技能目录。以 Codex 为例:mkdir -p .codex/skills,然后将 skills/harness-engineering 复制到 .codex/skills/;Claude Code 项目可使用 .claude/skills/,Cursor 项目可使用 .cursor/skills/。不要把 SKILL.md 展平成单个文件。仓库整体许可证为 MIT。
如何使用这个 Skill?
在支持 Agent Skills 的客户端中提出与自主智能体控制相关的任务,例如:“设计一个带锁定评估器、追加日志、失败回滚和人工合并审批的自主研究循环。”技能会围绕可编辑表面、反馈、持久化和治理边界给出设计建议。具体客户端中的自动激活命令未在该技能中说明。
这个 Skill 与同类方案有什么区别?
它与仓库中的 evaluation 技能边界不同:本技能关注自主控制表面、持久化、回滚和审批,而 evaluation 负责一般质量门和评估框架。它也不同于 tool-design 的工具契约与错误恢复,以及 hosted-agents 的远程沙箱和托管基础设施。