开发与工程 harness-engineeringautonomous-workflowsevaluation-gatesdurable-loggingrollbackhuman-approval

自主智能体控制台

为自主智能体设计可控、可恢复、可审计的运行框架。

FollowSkills 评估 · FSRS-2.0
不推荐
49/ 100 五分制 2.5 / 5
信任安全12 / 25 · 2.4/5

技能明确区分锁定、可编辑、追加写入和人工控制表面,要求回滚、持久化日志及合并/部署的人审,体现了权限边界与外部影响控制。未说明敏感数据处理、凭据隔离、依赖安全、数据流披露或通用恢复方案,因此扣分。

可靠稳定8 / 20 · 2.0/5

正文结构一致,涵盖保持、丢弃、崩溃、超时和审查状态,并给出循环与检查清单。技能本身没有可执行脚本、测试或具体异常输入/失败消息示例,关键路径无法静态复现,因此按静态上限保守扣分。

适用触发11 / 15 · 3.7/5

触发场景具体,并明确排除 evaluation、tool-design、project-development 和 hosted-agents 等相邻范围;同时覆盖研究、实验、PR 和后台代理。未定义标准输入输出、更多非适用边界、中文使用方式或中国大陆网络环境适配,因此扣分。

规范维护9 / 15 · 3.0/5

信息架构清晰,具备概念、详细主题、实践清单、文件布局、示例、陷阱和集成说明;仓库提供 MIT 许可,技能含创建时间、更新时间、作者和版本。缺少本技能专属变更记录、维护责任人和明确更新路径,内部参考文件也未随本次证据提供,因此扣分。

有效结果6 / 15 · 2.0/5

锁定评估器、窄化编辑面、耐久日志、创新门和人工审批等建议可直接转化为设计决策,且示例覆盖典型 harness 模式。输出主要是概念指导而非可运行实现,引用的内部运行手册未提供,仍需较多工程适配与验证,因此未超过静态上限并扣分。

证据核验3 / 10 · 1.5/5

技能列出了 Karpathy autoresearch、Prime Intellect、AlphaEvolve、FunSearch、HELM 和 LM Evaluation Harness 等参考方向,具备一定追溯线索。未提供具体链接、引用定位、提交测试或针对本技能关键路径的验证证据,且本次未执行任何内容,因此仅给有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 c578e85e40fe
使用前请注意
  • 这是仅基于静态文件的低置信度评估,未执行任何脚本、测试或示例。
  • 实施时应补充凭据/敏感数据隔离、网络与文件权限、超时和崩溃恢复、回滚边界及用户确认规则。
  • 外部资源和内部参考文件未在本次材料中得到逐项验证;不要将文档中的研究或仓库级 CI 声明视为本技能已通过运行验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

Harness Engineering 用于设计围绕智能体运行的控制系统,明确其可编辑范围、反馈机制、状态持久化和审批边界。它覆盖研究循环、评估脚手架、锁定与可编辑表面、持久化日志、新颖性门控、剪枝、回滚和 PR 准备。该技能特别适合需要长时间自主运行、但仍要求防止指标作弊和未经授权操作的系统。仓库采用 MIT 许可证,并将此技能作为 23 个独立技能之一提供。

指导用户划分锁定、可编辑、只追加和人工控制的工作表面;设计带有评估、保留或丢弃、崩溃、超时、回滚和人工复核状态的循环;将计划、来源队列、结果、失败记录和交接信息写入文件;为研究转技能流程加入来源检索、新颖性检查、机制注册表和剪枝规则;设计监控报告与自动生成 PR 但不自动合并的治理流程。

  1. 研究团队构建会持续检索来源、评估候选方案并提出技能变更的自主研究循环。
  2. 工程团队让智能体优化代码或提示词,同时锁定评估脚本和指标,避免智能体修改基准。
  3. 平台团队运行会持续数小时或数天的后台智能体,并需要通过线程日志和结果文件恢复状态。
  4. 维护者希望智能体准备 PR、运行检查并生成摘要,但将合并、部署和破坏性操作保留给人工审批。
  5. 系统设计者需要检测重复机制、保存失败尝试,并通过剪枝控制自主实验堆栈的复杂度。

这个 Skill 有哪些优点和局限?

优点
  • 明确区分智能体可修改内容与必须锁定或人工控制的表面。
  • 覆盖持久化日志、失败记录、回滚、新颖性检查和剪枝等长时运行机制。
  • 提供自动实验循环、研究转技能循环和自动 PR 准备的具体流程。
  • 强调来源检索证据、逐维度评分和人工审批,针对指标作弊给出防护措施。
局限
  • 它主要提供设计原则、流程和伪代码;该技能目录内容未提供可直接运行的实现脚本。
  • 未看到针对特定客户端、部署环境或运行时的完整配置示例。
  • 技能本身未展示独立测试套件或实测性能数据,采用前仍需在目标环境验证。
  • 虽然涉及来源刷新和文件状态管理,但具体网络服务、存储后端和权限模型未被规定。

如何安装这个 Skill?

将仓库作为插件目录添加,或复制该技能目录到项目的技能目录。以 Codex 为例:mkdir -p .codex/skills,然后将 skills/harness-engineering 复制到 .codex/skills/;Claude Code 项目可使用 .claude/skills/,Cursor 项目可使用 .cursor/skills/。不要把 SKILL.md 展平成单个文件。仓库整体许可证为 MIT。

如何使用这个 Skill?

在支持 Agent Skills 的客户端中提出与自主智能体控制相关的任务,例如:“设计一个带锁定评估器、追加日志、失败回滚和人工合并审批的自主研究循环。”技能会围绕可编辑表面、反馈、持久化和治理边界给出设计建议。具体客户端中的自动激活命令未在该技能中说明。

这个 Skill 与同类方案有什么区别?

它与仓库中的 evaluation 技能边界不同:本技能关注自主控制表面、持久化、回滚和审批,而 evaluation 负责一般质量门和评估框架。它也不同于 tool-design 的工具契约与错误恢复,以及 hosted-agents 的远程沙箱和托管基础设施。

常见问题

这个技能会替我自动运行或部署智能体吗?
不会。它提供运行循环和治理设计建议,并明确将合并、部署、凭据和破坏性操作置于人工审批边界内。
是否需要外部网络服务或特定依赖?
技能描述了上游来源刷新和来源检索,因此实际研究循环可能需要网络访问;但未指定必须安装的语言、框架或第三方服务。
它适合普通评估任务吗?
如果任务只有质量指标、回归测试或评分框架,应优先考虑仓库中的 `evaluation`;本技能适合带有自主控制面的长时运行循环。

同仓库的其他 Skills

均来自 muratcankoylan/Agent-Skills-for-Context-Engineering

开发与工程

长程智能体提示设计

为长期自主运行和并行多智能体任务设计可验证、抗近似交付的启动提示。

开发与工程

上下文工程与智能体系统指南

帮助团队设计、优化和评估具备可靠上下文管理能力的生产级智能体系统。

开发与工程

自我改进循环

让智能体系统在受控评估中迭代自身的上下文、工作流与代码。

开发与工程

Agent 评估方法

为智能体流水线建立可重复的评估、回归检测与质量门禁。

开发与工程

高级 LLM 评测

为 LLM 输出构建可审计、可校准并能缓解评测偏差的自动化评估流程。

开发与工程

上下文工程基础

用注意力预算和上下文质量原则,理解并设计更可靠的智能体上下文。

开发与工程

潜在简报

通过任务引导的 KV 缓存压缩,在可控运行时高效共享编排器与工作器之间的上下文状态。

开发与工程

持久语义记忆架构

帮助智能体设计可扩展、可检索且能处理时间变化的持久记忆系统。

开发与工程

上下文压缩策略

在长期代理会话中压缩上下文,同时保留文件变更、决策和后续行动。

开发与工程

Agent Skill 蓝图模板

为上下文工程技能提供可复用的结构、边界和质量检查框架。

开发与工程

多智能体架构模式

帮助你设计具备上下文隔离、协调协议和可靠交接机制的多智能体系统。

开发与工程

上下文退化诊断

定位并缓解长上下文中的注意力丢失、污染、干扰、混淆与冲突。

开发与工程

智能体工具设计指南

帮助你设计清晰、可路由、可恢复的智能体工具接口。

开发与工程

项目级智能体开发方法论

帮助你判断是否该用大语言模型,并设计可迭代、可解析、可控成本的智能体项目流水线。

开发与工程

BDI 心智状态建模

把 RDF 上下文转化为可解释的信念、愿望与意图链。

开发与工程

严谨研究代理

为多步骤研究建立验证、故障恢复与来源追踪流程。

开发与工程

文件系统上下文工程

将大型、持久或共享的代理上下文移入文件,按需检索以减少上下文压力。

开发与工程

上下文效率优化

通过缓存、遮蔽、压缩与分区降低上下文成本,同时保护回答质量。

效率与协作

数字大脑个人操作系统

用结构化文件和 AI 管理内容、关系、知识与目标。

开发与工程

推理轨迹优化器

通过分析智能体的推理轨迹,定位上下文、工具和指令问题,并迭代优化提示词。

相关 Skills