开发与工程 knowledge-graphagent-memoryfeedback-loopskill-evaluationjson-outputpr-review

技能反馈写作器

评估另一个技能的输出,找出缺失的指令并生成结构化反馈,以改进该技能。

FollowSkills 评估 · FSRS-2.0
不推荐
37/ 100 五分制 1.9 / 5
1 2 3 4 5 6
1信任安全8 / 25 · 1.6/5

该技能仅用于评估其他技能的输出并生成JSON反馈,不涉及敏感数据处理或外部副作用。但技能指示在没有用户确认的情况下直接输出评分和指令,缺少权限最小化、用户确认或数据流透明度的明确表述,且依赖未经验证的输出内容。扣除7分。

2可靠稳定5 / 20 · 1.3/5

技能描述清晰,但缺乏明确的实现细节、错误处理和边界条件。没有测试或可复现的示例,无法确认其可靠执行。扣除5分。

3适用触发7 / 15 · 2.3/5

技能针对特定任务(改进pr-comment-evaluator),但未明确定义使用场景、非适用场景或触发条件。中文支持未提及。扣除8分。

4规范维护7 / 15 · 2.3/5

技能提供了基本的信息架构和输出格式,但缺少安装依赖说明、版本信息、维护责任和更新路径。没有已知限制的披露。扣除8分。

5有效结果6 / 15 · 2.0/5

技能能完成基本任务(生成JSON输出),但输出是否直接可用取决于下游技能,缺少示例或验证。扣除9分。

6证据核验4 / 10 · 2.0/5

没有测试或其他验证材料,仅基于静态阅读。无法独立验证其行为。扣除6分。

证据充分度: 评估于 2026年8月7日 审查版本 38eece5bbb0c
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 技能可能产生不准确的反馈,因为它依赖未被验证的输出内容。
  • 技能未提供错误处理或边界情况说明,可能导致意外行为。
  • 技能未提及中文支持或从中国大陆网络的可用性。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能作为自动化质量评估器,判断另一个技能(如 pr-comment-evaluator)的输出是否足够好。它分析差异风险摘要和评论评估,并输出一份 JSON 报告,指出该技能是否有效,或者是否缺少关键指令。它根据指定规则给出 0.0-1.0 的评分,优先考虑运行时风险而非语气等表面问题。该技能旨在通过提供可操作的反馈来改进技能库。

读取被评估技能的输入(差异风险摘要、评论评估)和输出,应用预定义逻辑(例如,如果 pr-comment-evaluator 仅评估语气或未能将评论与运行时风险匹配,则优先改进它),并生成一个 JSON 对象,包含多个键:diff_risk_summary、comment_evaluation、skill_to_improve、score、feedback、missing_instruction。它会根据缺失的重要项目分配分数,并为改进提供清晰的反馈。

  1. 当需要自动化检查另一个技能(如 pr-comment-evaluator)是否表现良好时。
  2. 当您希望根据对技能输出的评估来持续改进技能库时。
  3. 当您需要一种标准化的方法来识别技能中缺失的指令时。
  4. 当您想要一个可重复使用的质量门,确保技能满足明确的标准。

这个 Skill 有哪些优点和局限?

优点
  • 为技能改进提供清晰、结构化的反馈。
  • 根据具体标准提供客观评分(0.0-1.0)。
  • 防止表面改进,专注关键运行时风险。
  • 易于与自动化管道集成。
局限
  • 技能文档仅描述了概念,未提供输入/输出的具体格式。
  • 未提供测试或在特定平台上的验证证据。
  • 假设被评估的技能遵循特定命名约定(pr-comment-evaluator)。
  • 依赖被评估技能能够提供所需输入,这可能并不总是可用。

如何安装这个 Skill?

将整个仓库克隆到本地,或在您的技能目录中手动创建该技能文件夹。技能路径为:examples/demos/skill_feedback_loop/skills/skill-feedback-writer/SKILL.md。需要将其放入遵循 Agent Skills 标准(包含 SKILL.md 的文件夹及其可选文件)的目录中。

如何使用这个 Skill?

提供被评估技能评估的输入(通常为 JSON 格式,包含差异风险摘要和评论评估),并要求该技能对其进行评估。例如,您可以说:“评估此 pr-comment-evaluator 的输出。”该技能将返回一个 JSON 对象,包含评估结果。可以通过任何支持 Agent Skills 框架的客户端使用,包括 Claude Code 或 Codex。

这个 Skill 与同类方案有什么区别?

此技能与仓库中的其他技能(如 pr-comment-evaluator 和 diff-risk-explainer)相关并对其做出响应,但未提及其他外部工具。

常见问题

此技能如何确定缺失的指令?
它根据预定义逻辑(例如,当评论评估仅关注语气或未针对运行时风险时,标记异常)分析被评估技能的输出,并生成缺失指令的文本描述。
评分标准是什么?
评分为 0.0-1.0,分数越低表示缺失关键要求。具体规则(例如,如果评论评估仅关注语气,则设置 0.30 或更低)在 SKILL.md 中定义。
此技能是否特定于 Claude Code?
不,它以通用格式描述,使用标准输入/输出,符合 Agent Skills 标准,因此与支持此类技能的多个平台兼容。
我需要提供什么?
您需要提供被评估技能的输入,通常是差异风险摘要和评论评估。确切的格式未指定,但很可能是 JSON。

同仓库的其他 Skills

均来自 topoteretes/cognee

相关 Skills