高级 LLM 评测
为 LLM 输出构建可审计、可校准并能缓解评测偏差的自动化评估流程。
技能主要提供评估指导和示例代码,未显示恶意行为、凭证窃取、隐蔽外传或破坏性默认操作,因此保留较高分;但未明确数据流、敏感数据处理、用户确认、权限边界、回滚和依赖安全,且示例涉及外部模型调用,扣分。
文档结构自洽,覆盖输入校验、错误处理、重试、偏差缓解和测试模式;但实际实现是伪代码,存在未定义依赖、未提供可直接运行的端到端实现,选定技能没有专门测试套件,故受静态上限约束并扣分。
激活条件、相邻技能边界和直接评分/成对比较/量规生成场景较清楚,且强调平台无关;但未明确输入输出契约、非适用范围仍有限,也没有中文使用指导或中国大陆环境适配说明,扣分。
具备渐进式结构、参考资料、脚本示例、创建日期、更新时间、作者、版本和 MIT 许可;但维护责任与更新流程不具体,安装和依赖说明主要位于仓库级 README,部分生产级表述与伪代码实现不完全匹配,扣分。
能够直接提供评估分类、偏差缓解、置信度和量规设计的可操作框架,并含结构化示例;但输出仍需按具体运行时重写,缺少可直接部署的实现、依赖锁定和目标任务上的验证,静态上限下扣分。
包含学术和行业参考名称、代码示例、测试模式及仓库级 CI 证据;但选定技能的关键路径没有专门可复现实测,引用未逐项绑定主张,且部分数字和效果声明缺乏文件内第三方验证,因此仅给有限分。
- 示例代码标注为伪代码,不能据此视为可直接运行或已通过集成测试。
- 外部研究链接和“方差降低40–60%”等效果表述未在选定技能内提供逐项、可复核的证据。
- 使用真实模型、第三方库或事实核查服务时,应另行审查网络访问、数据隐私、费用、版本锁定和故障回退。
- 技能未提供中文术语、中文提示模板或中国大陆网络可达性的专门说明。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用 LLM 作为评审器的生产级评测系统。它帮助用户在直接评分、成对比较和基于参考答案的评测之间进行选择,并设计评分量表、领域化标准和置信度校准。内容重点覆盖位置偏差、长度偏差、自我增强偏差、冗长偏差和权威偏差等问题。它适合需要将自动评测结果与人工判断进行比较、监控系统性分歧并持续迭代的团队。
它指导用户定义评测标准、权重和评分量表,要求评审器先提供可观察证据再给出分数;为成对比较设计交换候选项位置的双轮评测、一致性检查、平局判定和置信度计算;生成包含等级描述、可观察特征、示例和边界情况的领域化量规;根据任务类型选择 Precision、Recall、F1、Spearman 相关、Kendall tau、协议一致率或位置一致性等指标;设计包含标准加载、评分、偏差缓解、置信度评分和结果输出的评测流水线。
- 评测工程师在客观标准明确的任务中,为单条 LLM 回复建立 1–3、1–5 或 1–10 的直接评分流程。
- 模型团队比较两个候选回复的语气、风格、说服力或创造性,并通过交换展示顺序缓解位置偏差。
- 质量团队为代码可读性、事实准确性或其他领域标准生成带等级说明和边界案例的评分量规。
- 研究人员分析自动评审与人工判断之间的相关性,并按标准、回复类型或模型追踪系统性分歧。
- 高流量评测系统使用多模型评审、分层评测或人工复核处理高风险和低置信度案例。
这个 Skill 有哪些优点和局限?
- 覆盖直接评分、成对比较、量规生成、偏差缓解和置信度校准等完整评审设计环节。
- 提供可直接改写的提示词结构、决策树、指标选择表和生产流水线分层。
- 明确区分客观标准与主观偏好,并强调证据优先、位置交换和系统性偏差监控。
- 包含多模型评审、分层评测和人工复核等规模化策略。
- 技能提供设计模式和示例,但未展示该技能自身的独立测试套件或目标数据集上的验证结果。
- LLM 评审仍可能受到位置、长度、冗长、自我增强和权威等偏差影响,需要额外校准与监控。
- 多模型评审和高质量人工复核会增加成本;源材料未规定具体模型、供应商或运行预算。
- 它不负责通用确定性检查、回归测试、质量门禁、评测工具 API 合约或自治循环治理。
如何安装这个 Skill?
从 https://github.com/muratcankoylan/Agent-Skills-for-Context-Engineering 获取仓库,并将完整的 skills/advanced-evaluation 文件夹复制到目标客户端的技能目录中,例如:mkdir -p .codex/skills && cp -R skills/advanced-evaluation .codex/skills/。也可复制到 .claude/skills/ 或通用的 .agents/skills/。不要只复制 SKILL.md;源材料未说明其他平台的具体安装命令。
如何使用这个 Skill?
在已安装该技能的 Agent Skills 客户端中,提出具体的高级评测任务,例如:“为一个比较两个客服回复质量的 LLM-as-a-Judge 系统设计成对评测流程,包含位置交换、偏差缓解、置信度和 JSON 输出。”适用触发场景包括构建 LLM 评审器、比较多个模型回复、设计 A/B 测试、校准量规或分析自动与人工判断的相关性。
这个 Skill 与同类方案有什么区别?
源材料明确将直接评分与成对比较作为两种主要方法:存在客观标准时使用直接评分;主观偏好或质量判断通常使用成对比较;有参考答案时可考虑基于参考答案的评测。未提供与具体第三方产品的对比。