长程智能体提示设计
为长期自主运行和并行多智能体任务设计可验证、抗近似交付的启动提示。
技能明确区分提示词约束与运行时 harness,要求外部执行预算、权限、日志和审批边界,并设置污染防护;但未具体规定用户确认、敏感数据处理、回滚或数据流披露,且多项安全约束仅停留在提示词层面,因此扣分。
结构完整,包含成功谓词、失败模式、审计、停止条件和报告契约;但示例 Block 6 同时允许失败时返回最强部分结果又禁止返回部分结果,且没有针对关键路径的可执行测试或异常输入反馈。静态评估按上限保守扣分。
触发场景、非适用范围及与相邻技能的边界写得清楚,模板可迁移到数学和工程问题;但对中文用户、国内网络环境、模型能力差异和长运行资源限制缺乏明确适配说明,部分示例依赖特定多智能体能力。
信息架构、渐进披露、模板、示例、陷阱、引用、许可证和安装说明较完整;但选定技能没有明确版本号、变更日志、维护责任人或更新路径,且文档中存在仓库技能数量与 README 数量表述不一致的维护信号。
提供了可直接复制的伪形式化任务简报模板、工作流、审计清单和示例,足以完成提示词设计的核心任务;但没有本技能关键路径的实际运行结果或可验证用户任务产出,且硬预算、权限和状态账本仍需其他技能或 harness 补足。
引用了论文标识、供应商指导和带日期的证据,并主动披露候选证明缺乏同行评审和形式化;但本次仅有静态文件,未提供可复现实验结果、独立复核链或覆盖技能行为的专门测试,因此证据覆盖有限。
- 这是低置信度静态审查;未执行技能、示例或 CI。
- 不要把“假设存在解”、努力下限或提示词中的权限限制当作真实安全控制;应由外部 harness 强制执行预算、权限、审批、日志和停止条件。
- Block 6 的部分结果回退条款与最终禁止部分结果存在冲突,使用模板前应明确仅在外部预算耗尽时允许不完整返回。
- 文档中的研究、供应商指导和 CDC 候选证明需要单独核验,不能视为已证实的效果或数学结论。
这个 Skill 能做什么,适合哪些场景?
该技能用于编写、增强和评估长时间运行的自主智能体或并行多智能体编排的启动提示。它以“伪形式化任务简报”为核心,要求明确术语、成功谓词、非计入结果、持久化规则和审计门槛。内容还涵盖并行方案多样性、阻塞路线登记、证据化报告和对抗性验证。它适合需要严格交付标准的复杂开放式问题,但不负责运行时预算、评估器或多智能体拓扑本身。
它指导用户先定义成功谓词和边界情况,再列出不算完成的近似结果、领域特定失败模式、并行方案登记规则、努力下限、污染防护和审计式返回条件。它生成适用于根编排器或单个长期运行智能体的任务简报结构、预发布检查表和示例提示。它不执行智能体循环,不提供运行时控制,也不替代评估、记忆或多智能体基础设施。
- 研究人员在启动数小时或数天的开放式研究任务前,需要把“解决某问题”改写成可检查的成功条件。
- 工程团队为根编排器设计并行搜索提示,想避免所有工作者过早收敛到同一方案。
- 评估人员审查长期运行提示,重点检查近似完成、循环论证和伪造进展报告。
- 调试失败的自主运行:问题表现为过早返回、只完成缩小范围的任务,或用状态报告代替具体成果。
- 需要为复杂分析任务加入努力下限、证据追踪和对抗性返回门槛的团队。
这个 Skill 有哪些优点和局限?
- 提供从定义、成功谓词到审计返回条件的完整简报结构。
- 明确处理缩小范围答案、未证明归约、有限验证和状态报告表演等常见近似交付。
- 针对并行搜索提供方案族登记、阻塞路线记录、早期独立和后期交叉污染策略。
- 强调把运行时预算和不可绕过的约束放入 harness,而不是只写在提示中。
- 它只设计启动提示,不执行循环、并行调度、评估器、持久化账本或运行时权限控制。
- 成功谓词和失败模式仍需要领域专家提供,技能不会自动发现每个领域的隐藏漏洞。
- 来源中的 Cycle Double Cover 候选证明在发布时没有独立同行评审或形式化,因此该案例不能作为定理正确性的证据。
- 没有提供特定平台 API、运行时配置或成本估算。
如何安装这个 Skill?
将仓库中的 skills/long-horizon-prompting 整个目录复制到兼容 Agent Skills 的技能目录,例如 Codex 项目的 .codex/skills/ 或通用项目的 .agents/skills/。不要只复制 SKILL.md 文件,因为技能采用目录布局。仓库 README 也提供了将整个集合安装为 Claude Code 插件的命令:/plugin marketplace add muratcankoylan/Agent-Skills-for-Context-Engineering,然后安装 context-engineering@context-engineering-marketplace。
如何使用这个 Skill?
在需要编写或审查长期自主运行提示时,明确提出类似请求:“为一个长期运行的并行多智能体研究任务编写启动提示,包含成功谓词、非计入结果、领域失败模式、方案多样性、证据化报告和审计式返回条件。”技能会引导你先写成功谓词,再补充定义、审计清单、编排策略和返回门槛。具体运行命令、预算执行和外部工具配置未在该技能中定义。
这个 Skill 与同类方案有什么区别?
与 multi-agent-patterns 相比,本技能负责提示措辞和编排政策,而不是拓扑、交接和协调协议;与 harness-engineering、evaluation 和 advanced-evaluation 相比,它负责在提示中提出约束和审计要求,不负责运行时强制、确定性评估器或裁判设计。