开发与工程 llm-evaluationpairwise-comparisondirect-scoringrubric-designbias-mitigationconfidence-calibrationquality-assessment

高级 LLM 评测

为 LLM 输出构建可审计、可校准并能缓解评测偏差的自动化评估流程。

FollowSkills 评估 · FSRS-2.0
不推荐
56/ 100 五分制 2.8 / 5
信任安全17 / 25 · 3.4/5

技能主要提供评估指导和示例代码,未显示恶意行为、凭证窃取、隐蔽外传或破坏性默认操作,因此保留较高分;但未明确数据流、敏感数据处理、用户确认、权限边界、回滚和依赖安全,且示例涉及外部模型调用,扣分。

可靠稳定8 / 20 · 2.0/5

文档结构自洽,覆盖输入校验、错误处理、重试、偏差缓解和测试模式;但实际实现是伪代码,存在未定义依赖、未提供可直接运行的端到端实现,选定技能没有专门测试套件,故受静态上限约束并扣分。

适用触发11 / 15 · 3.7/5

激活条件、相邻技能边界和直接评分/成对比较/量规生成场景较清楚,且强调平台无关;但未明确输入输出契约、非适用范围仍有限,也没有中文使用指导或中国大陆环境适配说明,扣分。

规范维护10 / 15 · 3.3/5

具备渐进式结构、参考资料、脚本示例、创建日期、更新时间、作者、版本和 MIT 许可;但维护责任与更新流程不具体,安装和依赖说明主要位于仓库级 README,部分生产级表述与伪代码实现不完全匹配,扣分。

有效结果6 / 15 · 2.0/5

能够直接提供评估分类、偏差缓解、置信度和量规设计的可操作框架,并含结构化示例;但输出仍需按具体运行时重写,缺少可直接部署的实现、依赖锁定和目标任务上的验证,静态上限下扣分。

证据核验4 / 10 · 2.0/5

包含学术和行业参考名称、代码示例、测试模式及仓库级 CI 证据;但选定技能的关键路径没有专门可复现实测,引用未逐项绑定主张,且部分数字和效果声明缺乏文件内第三方验证,因此仅给有限分。

证据充分度: 评估于 2026年7月20日 审查版本 c578e85e40fe
使用前请注意
  • 示例代码标注为伪代码,不能据此视为可直接运行或已通过集成测试。
  • 外部研究链接和“方差降低40–60%”等效果表述未在选定技能内提供逐项、可复核的证据。
  • 使用真实模型、第三方库或事实核查服务时,应另行审查网络访问、数据隐私、费用、版本锁定和故障回退。
  • 技能未提供中文术语、中文提示模板或中国大陆网络可达性的专门说明。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 LLM 作为评审器的生产级评测系统。它帮助用户在直接评分、成对比较和基于参考答案的评测之间进行选择,并设计评分量表、领域化标准和置信度校准。内容重点覆盖位置偏差、长度偏差、自我增强偏差、冗长偏差和权威偏差等问题。它适合需要将自动评测结果与人工判断进行比较、监控系统性分歧并持续迭代的团队。

它指导用户定义评测标准、权重和评分量表,要求评审器先提供可观察证据再给出分数;为成对比较设计交换候选项位置的双轮评测、一致性检查、平局判定和置信度计算;生成包含等级描述、可观察特征、示例和边界情况的领域化量规;根据任务类型选择 Precision、Recall、F1、Spearman 相关、Kendall tau、协议一致率或位置一致性等指标;设计包含标准加载、评分、偏差缓解、置信度评分和结果输出的评测流水线。

  1. 评测工程师在客观标准明确的任务中,为单条 LLM 回复建立 1–3、1–5 或 1–10 的直接评分流程。
  2. 模型团队比较两个候选回复的语气、风格、说服力或创造性,并通过交换展示顺序缓解位置偏差。
  3. 质量团队为代码可读性、事实准确性或其他领域标准生成带等级说明和边界案例的评分量规。
  4. 研究人员分析自动评审与人工判断之间的相关性,并按标准、回复类型或模型追踪系统性分歧。
  5. 高流量评测系统使用多模型评审、分层评测或人工复核处理高风险和低置信度案例。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖直接评分、成对比较、量规生成、偏差缓解和置信度校准等完整评审设计环节。
  • 提供可直接改写的提示词结构、决策树、指标选择表和生产流水线分层。
  • 明确区分客观标准与主观偏好,并强调证据优先、位置交换和系统性偏差监控。
  • 包含多模型评审、分层评测和人工复核等规模化策略。
局限
  • 技能提供设计模式和示例,但未展示该技能自身的独立测试套件或目标数据集上的验证结果。
  • LLM 评审仍可能受到位置、长度、冗长、自我增强和权威等偏差影响,需要额外校准与监控。
  • 多模型评审和高质量人工复核会增加成本;源材料未规定具体模型、供应商或运行预算。
  • 它不负责通用确定性检查、回归测试、质量门禁、评测工具 API 合约或自治循环治理。

如何安装这个 Skill?

从 https://github.com/muratcankoylan/Agent-Skills-for-Context-Engineering 获取仓库,并将完整的 skills/advanced-evaluation 文件夹复制到目标客户端的技能目录中,例如:mkdir -p .codex/skills && cp -R skills/advanced-evaluation .codex/skills/。也可复制到 .claude/skills/ 或通用的 .agents/skills/。不要只复制 SKILL.md;源材料未说明其他平台的具体安装命令。

如何使用这个 Skill?

在已安装该技能的 Agent Skills 客户端中,提出具体的高级评测任务,例如:“为一个比较两个客服回复质量的 LLM-as-a-Judge 系统设计成对评测流程,包含位置交换、偏差缓解、置信度和 JSON 输出。”适用触发场景包括构建 LLM 评审器、比较多个模型回复、设计 A/B 测试、校准量规或分析自动与人工判断的相关性。

这个 Skill 与同类方案有什么区别?

源材料明确将直接评分与成对比较作为两种主要方法:存在客观标准时使用直接评分;主观偏好或质量判断通常使用成对比较;有参考答案时可考虑基于参考答案的评测。未提供与具体第三方产品的对比。

常见问题

使用该技能是否需要特定模型或付费服务?
源材料未指定特定模型或运行服务。它指出多模型评审更昂贵,但可能对高风险决策更可靠。
它会自动运行评测或调用外部工具吗?
SKILL.md 主要提供设计方法、提示词结构和示例,没有声明 MCP、外部 API 或特定工具依赖。
成对比较为什么要评测两次?
因为单轮比较可能受到候选项位置偏差影响。技能要求交换 A、B 的位置后再次评测,并在结果不一致时返回降低置信度的平局。
它适合所有质量门禁和回归测试吗?
不适合。该技能负责 LLM 评审器设计和偏差缓解;确定性检查、回归套件、生产质量门禁和监控属于相邻的 evaluation 技能。

同仓库的其他 Skills

均来自 muratcankoylan/Agent-Skills-for-Context-Engineering

开发与工程

Agent 评估方法

为智能体流水线建立可重复的评估、回归检测与质量门禁。

开发与工程

长程智能体提示设计

为长期自主运行和并行多智能体任务设计可验证、抗近似交付的启动提示。

开发与工程

持久语义记忆架构

帮助智能体设计可扩展、可检索且能处理时间变化的持久记忆系统。

开发与工程

智能体工具设计指南

帮助你设计清晰、可路由、可恢复的智能体工具接口。

开发与工程

上下文压缩策略

在长期代理会话中压缩上下文,同时保留文件变更、决策和后续行动。

开发与工程

项目级智能体开发方法论

帮助你判断是否该用大语言模型,并设计可迭代、可解析、可控成本的智能体项目流水线。

开发与工程

自主智能体控制台

为自主智能体设计可控、可恢复、可审计的运行框架。

开发与工程

上下文工程与智能体系统指南

帮助团队设计、优化和评估具备可靠上下文管理能力的生产级智能体系统。

开发与工程

自我改进循环

让智能体系统在受控评估中迭代自身的上下文、工作流与代码。

开发与工程

上下文工程基础

用注意力预算和上下文质量原则,理解并设计更可靠的智能体上下文。

开发与工程

潜在简报

通过任务引导的 KV 缓存压缩,在可控运行时高效共享编排器与工作器之间的上下文状态。

开发与工程

多智能体架构模式

帮助你设计具备上下文隔离、协调协议和可靠交接机制的多智能体系统。

开发与工程

上下文退化诊断

定位并缓解长上下文中的注意力丢失、污染、干扰、混淆与冲突。

开发与工程

BDI 心智状态建模

把 RDF 上下文转化为可解释的信念、愿望与意图链。

开发与工程

严谨研究代理

为多步骤研究建立验证、故障恢复与来源追踪流程。

开发与工程

文件系统上下文工程

将大型、持久或共享的代理上下文移入文件,按需检索以减少上下文压力。

开发与工程

上下文效率优化

通过缓存、遮蔽、压缩与分区降低上下文成本,同时保护回答质量。

开发与工程

Agent Skill 蓝图模板

为上下文工程技能提供可复用的结构、边界和质量检查框架。

效率与协作

数字大脑个人操作系统

用结构化文件和 AI 管理内容、关系、知识与目标。

开发与工程

推理轨迹优化器

通过分析智能体的推理轨迹,定位上下文、工具和指令问题,并迭代优化提示词。

相关 Skills