开发与工程 research-validationerror-recoverysource-traceabilitycross-source-validationreasoning-transparency

严谨研究代理

为多步骤研究建立验证、故障恢复与来源追踪流程。

FollowSkills 评估 · FSRS-2.0
不推荐
45/ 100 五分制 2.3 / 5
信任安全13 / 25 · 2.6/5

技能要求记录工具失败、来源可追溯、交叉验证和限制,降低静默错误与虚构引用风险,因此获得部分信任分。但未规定最小权限、用户确认、敏感数据处理、外部副作用隔离、回滚或依赖安全;“详细推理块”还可能暴露不必要的内部信息,故扣分。

可靠稳定8 / 20 · 2.0/5

核心流程在指令层面前后一致,涵盖来源排序、错误恢复、完成前检查和文件内容验证,说明正常路径可行,因此给予静态上限内的中等分数。但未提供可执行实现、统一工具接口、具体异常分类或可复现的关键路径测试,失败反馈仍依赖执行代理自行解释,故扣分。

适用触发8 / 15 · 2.7/5

触发条件较明确,覆盖多来源研究、3次以上工具交互、文件验证和完整性要求,适用于研究型工作流。但未清晰声明非适用范围、输入输出契约或平台差异;依赖search/read_url/fetch等泛化工具,且没有中文输出或中国大陆网络可达性说明,故扣分。

规范维护7 / 15 · 2.3/5

SKILL.md结构清晰,包含激活条件、概念、反模式、实践、指南、示例和限制性提示;仓库上下文提供MIT许可证及CI信号。技能自身缺少稳定版本、变更记录、维护责任、更新路径、安装依赖和FAQ,且元数据中的生成与优化分数不是维护治理信息,故扣分。

有效结果6 / 15 · 2.0/5

验证检查点、错误确认、来源跟踪表、交叉验证和完成清单可直接指导研究代理,能够覆盖核心质量问题,因此给予接近静态上限的分数。但没有定义统一最终输出格式、可执行模板或针对该技能关键路径的直接结果证据,且强制详细推理块可能增加成本并需要较多人工落实,故扣分。

证据核验3 / 10 · 1.5/5

技能文本包含具体规则,references中有优化摘要、失败模式和建议,提供了一定可审计线索。可是这些材料主要是生成记录和作者侧分析,不是该技能关键路径的独立复现;所列测试覆盖其他组件,未证明本SKILL.md的行为,缺少第三方 corroboration,故仅给低分。

证据充分度: 评估于 2026年7月20日 审查版本 c578e85e40fe
使用前请注意
  • 仅凭静态文件审查,不能确认该技能在目标代理、工具集或文件系统中的实际行为。
  • 不要默认所有工具都支持所要求的思维块、来源跟踪表或read_file验证;应先映射到宿主环境。
  • 详细推理记录可能包含敏感数据或内部信息,应改为记录可审计摘要、来源、失败和决策依据。
  • 仓库中的优化分数和研究结论不应视为本技能的独立测试证据。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

严谨研究代理是一套用于多步骤研究任务的操作规范,重点处理工具错误、来源验证、信息完整性和过早下结论等问题。它要求在阶段转换时设置验证检查点,记录已成功获取和失败的来源,并对关键结论进行交叉验证。该技能还规定了结构化思考、错误确认和完成前检查清单。它更适合需要可审计研究流程的代理系统,而不是单纯的问答提示词。

指导代理执行来源评估、工具输出验证、失败确认与恢复、来源追踪、跨来源比较和完成前检查。它要求记录哪些 URL 已成功获取、哪些失败,以及每个来源支持哪些结论。它不包含脚本,也没有展示会自动调用的具体工具或固定输出文件。

  1. 研究人员在需要从多个来源汇总信息时,用它检查来源相关性、完整性和一致性。
  2. 代理工程师在设计包含搜索、读取 URL 或抓取操作的研究流程时,用它处理工具失败和备用策略。
  3. 需要可审计报告的团队,用它记录已检索证据与未验证信息之间的区别。
  4. 涉及文件保存、写入和读取的研究任务,可用它要求代理验证实际文件内容。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖来源评估、错误恢复、证据追踪和完成前验证等关键环节。
  • 明确要求记录失败与信息缺口,减少无依据的完成声明。
  • 适用于多来源研究和需要透明审计的工作流。
  • SKILL.md 仅使用 name 和 description 前置字段,没有显示平台专属扩展。
局限
  • 它是流程规范,不是自动化研究工具,不会自行搜索、抓取或写入文件。
  • 来源材料未提供脚本、测试套件或具体工具集成。
  • “结构化思考”要求较重,可能增加长任务的执行开销。
  • 来源未提供该单独技能在不同平台上的实测结果。

如何安装这个 Skill?

将包含 SKILL.md 的目录复制到项目的技能目录,并保留目录结构。例如:mkdir -p .codex/skills && cp -R examples/interleaved-thinking/generated_skills/comprehensive-research-agent .codex/skills/。README 明确要求技能以目录形式安装;该示例技能没有单独的专用安装命令。

如何使用这个 Skill?

在研究任务开始时提出需要多来源验证的请求,例如:“研究这个主题,记录每个成功获取的来源,处理工具失败,对关键结论进行交叉验证,并在完成前列出剩余缺口。” 当任务包含多次工具交互、完整性要求或文件验证时激活。

常见问题

使用这个技能需要付费服务吗?
来源没有说明该单独技能的费用,也没有声明需要特定付费服务。
它能自动处理搜索或抓取失败吗?
不能直接执行处理;它规定代理必须确认失败,并选择重试、替代来源或记录缺口等恢复策略。
它适合一次性的简单问题吗?
主要面向多来源、需要验证或包含三次以上工具交互的研究任务;简单问题可能不需要完整流程。
安装时可以只复制 SKILL.md 文件吗?
README 要求保留技能目录结构,不建议将 SKILL.md 展平为单个文件。

同仓库的其他 Skills

均来自 muratcankoylan/Agent-Skills-for-Context-Engineering

开发与工程

智能体工具设计指南

帮助你设计清晰、可路由、可恢复的智能体工具接口。

开发与工程

推理轨迹优化器

通过分析智能体的推理轨迹,定位上下文、工具和指令问题,并迭代优化提示词。

开发与工程

自我改进循环

让智能体系统在受控评估中迭代自身的上下文、工作流与代码。

开发与工程

长程智能体提示设计

为长期自主运行和并行多智能体任务设计可验证、抗近似交付的启动提示。

开发与工程

高级 LLM 评测

为 LLM 输出构建可审计、可校准并能缓解评测偏差的自动化评估流程。

开发与工程

上下文工程基础

用注意力预算和上下文质量原则,理解并设计更可靠的智能体上下文。

开发与工程

潜在简报

通过任务引导的 KV 缓存压缩,在可控运行时高效共享编排器与工作器之间的上下文状态。

开发与工程

多智能体架构模式

帮助你设计具备上下文隔离、协调协议和可靠交接机制的多智能体系统。

开发与工程

持久语义记忆架构

帮助智能体设计可扩展、可检索且能处理时间变化的持久记忆系统。

开发与工程

上下文退化诊断

定位并缓解长上下文中的注意力丢失、污染、干扰、混淆与冲突。

开发与工程

上下文压缩策略

在长期代理会话中压缩上下文,同时保留文件变更、决策和后续行动。

开发与工程

项目级智能体开发方法论

帮助你判断是否该用大语言模型,并设计可迭代、可解析、可控成本的智能体项目流水线。

开发与工程

BDI 心智状态建模

把 RDF 上下文转化为可解释的信念、愿望与意图链。

开发与工程

自主智能体控制台

为自主智能体设计可控、可恢复、可审计的运行框架。

开发与工程

Agent 评估方法

为智能体流水线建立可重复的评估、回归检测与质量门禁。

开发与工程

文件系统上下文工程

将大型、持久或共享的代理上下文移入文件,按需检索以减少上下文压力。

开发与工程

上下文效率优化

通过缓存、遮蔽、压缩与分区降低上下文成本,同时保护回答质量。

开发与工程

上下文工程与智能体系统指南

帮助团队设计、优化和评估具备可靠上下文管理能力的生产级智能体系统。

开发与工程

Agent Skill 蓝图模板

为上下文工程技能提供可复用的结构、边界和质量检查框架。

效率与协作

数字大脑个人操作系统

用结构化文件和 AI 管理内容、关系、知识与目标。

相关 Skills