严谨研究代理
为多步骤研究建立验证、故障恢复与来源追踪流程。
技能要求记录工具失败、来源可追溯、交叉验证和限制,降低静默错误与虚构引用风险,因此获得部分信任分。但未规定最小权限、用户确认、敏感数据处理、外部副作用隔离、回滚或依赖安全;“详细推理块”还可能暴露不必要的内部信息,故扣分。
核心流程在指令层面前后一致,涵盖来源排序、错误恢复、完成前检查和文件内容验证,说明正常路径可行,因此给予静态上限内的中等分数。但未提供可执行实现、统一工具接口、具体异常分类或可复现的关键路径测试,失败反馈仍依赖执行代理自行解释,故扣分。
触发条件较明确,覆盖多来源研究、3次以上工具交互、文件验证和完整性要求,适用于研究型工作流。但未清晰声明非适用范围、输入输出契约或平台差异;依赖search/read_url/fetch等泛化工具,且没有中文输出或中国大陆网络可达性说明,故扣分。
SKILL.md结构清晰,包含激活条件、概念、反模式、实践、指南、示例和限制性提示;仓库上下文提供MIT许可证及CI信号。技能自身缺少稳定版本、变更记录、维护责任、更新路径、安装依赖和FAQ,且元数据中的生成与优化分数不是维护治理信息,故扣分。
验证检查点、错误确认、来源跟踪表、交叉验证和完成清单可直接指导研究代理,能够覆盖核心质量问题,因此给予接近静态上限的分数。但没有定义统一最终输出格式、可执行模板或针对该技能关键路径的直接结果证据,且强制详细推理块可能增加成本并需要较多人工落实,故扣分。
技能文本包含具体规则,references中有优化摘要、失败模式和建议,提供了一定可审计线索。可是这些材料主要是生成记录和作者侧分析,不是该技能关键路径的独立复现;所列测试覆盖其他组件,未证明本SKILL.md的行为,缺少第三方 corroboration,故仅给低分。
- 仅凭静态文件审查,不能确认该技能在目标代理、工具集或文件系统中的实际行为。
- 不要默认所有工具都支持所要求的思维块、来源跟踪表或read_file验证;应先映射到宿主环境。
- 详细推理记录可能包含敏感数据或内部信息,应改为记录可审计摘要、来源、失败和决策依据。
- 仓库中的优化分数和研究结论不应视为本技能的独立测试证据。
这个 Skill 能做什么,适合哪些场景?
严谨研究代理是一套用于多步骤研究任务的操作规范,重点处理工具错误、来源验证、信息完整性和过早下结论等问题。它要求在阶段转换时设置验证检查点,记录已成功获取和失败的来源,并对关键结论进行交叉验证。该技能还规定了结构化思考、错误确认和完成前检查清单。它更适合需要可审计研究流程的代理系统,而不是单纯的问答提示词。
指导代理执行来源评估、工具输出验证、失败确认与恢复、来源追踪、跨来源比较和完成前检查。它要求记录哪些 URL 已成功获取、哪些失败,以及每个来源支持哪些结论。它不包含脚本,也没有展示会自动调用的具体工具或固定输出文件。
- 研究人员在需要从多个来源汇总信息时,用它检查来源相关性、完整性和一致性。
- 代理工程师在设计包含搜索、读取 URL 或抓取操作的研究流程时,用它处理工具失败和备用策略。
- 需要可审计报告的团队,用它记录已检索证据与未验证信息之间的区别。
- 涉及文件保存、写入和读取的研究任务,可用它要求代理验证实际文件内容。
这个 Skill 有哪些优点和局限?
- 覆盖来源评估、错误恢复、证据追踪和完成前验证等关键环节。
- 明确要求记录失败与信息缺口,减少无依据的完成声明。
- 适用于多来源研究和需要透明审计的工作流。
- SKILL.md 仅使用 name 和 description 前置字段,没有显示平台专属扩展。
- 它是流程规范,不是自动化研究工具,不会自行搜索、抓取或写入文件。
- 来源材料未提供脚本、测试套件或具体工具集成。
- “结构化思考”要求较重,可能增加长任务的执行开销。
- 来源未提供该单独技能在不同平台上的实测结果。
如何安装这个 Skill?
将包含 SKILL.md 的目录复制到项目的技能目录,并保留目录结构。例如:mkdir -p .codex/skills && cp -R examples/interleaved-thinking/generated_skills/comprehensive-research-agent .codex/skills/。README 明确要求技能以目录形式安装;该示例技能没有单独的专用安装命令。
如何使用这个 Skill?
在研究任务开始时提出需要多来源验证的请求,例如:“研究这个主题,记录每个成功获取的来源,处理工具失败,对关键结论进行交叉验证,并在完成前列出剩余缺口。” 当任务包含多次工具交互、完整性要求或文件验证时激活。