Agent 评估方法
为智能体流水线建立可重复的评估、回归检测与质量门禁。
技能仅提供评估逻辑与监控数据结构,不声明需要凭据、网络访问或破坏性写入,外部副作用风险较低;但未说明敏感生产交互数据的处理、留存、脱敏或用户确认机制,因此扣分。
文档与脚本存在接口和行为不一致:文档中的EvaluationRunner构造方式不同,脚本运行器使用模拟输出而非真实agent执行,且默认分数和字符串匹配启发式可能产生误判;未见覆盖该技能关键路径的测试,因此静态可靠性受限。
触发场景、相邻技能边界、评估主题和复杂度分层说明较清楚,且声称平台无关;但未明确输入输出契约、非适用范围的完整边界,也没有中文工作流或中国大陆网络适配证据,因此扣分。
目录结构、渐进式主题组织、参考文档、示例、版本、创建/更新时间、MIT许可证均较完整;但维护责任、正式更新路径、变更日志和依赖安装说明不充分,且文档与脚本存在维护漂移,因此扣分。
内容能直接指导构建多维评估、测试集和生产监控,脚本提供可复用类;但运行器只生成模拟输出,评估器大量依赖简单字符串启发式,缺乏真实任务适配和关键路径验证,仍需较多工程改造,因此未接近静态上限。
提交了实现脚本、参考定义和仓库级CI/测试材料,提供一定审计线索;但现有CI主要验证仓库及其他示例,未证明evaluation脚本的关键行为,也没有该技能专门的可复现实验结果,因此证据有限。
- 不要将scripts/evaluator.py的模拟运行结果视为真实agent评估证据。
- 在生产环境使用前,应补充真实agent适配、结构化校验、敏感数据脱敏/保留策略、失败处理和针对该技能的测试。
- 文档示例与脚本接口需要统一,否则使用者可能按文档调用失败。
这个 Skill 能做什么,适合哪些场景?
该技能用于构建智能体系统的评估框架,覆盖确定性检查、回归测试、多维评分标准、质量门禁、基线比较和生产监控。它强调评估最终结果,而不是固定执行路径,以适应智能体的非确定性和多种有效解法。内容还指导如何按复杂度设计测试集、分别衡量准确性与效率,并结合自动化评估和人工复核。适合需要持续验证上下文工程决策或智能体版本质量的开发团队。
指导用户定义质量维度和加权评分标准,构建分层测试集,先运行模式、结构和状态等确定性检查,再进行基于量规的质量判断;比较不同上下文策略、模型配置和多智能体架构的结果,记录基线、质量分数、令牌使用和工具调用,并为持续评估、生产采样、趋势分析和告警设定阈值。示例以 Python 伪代码和 YAML 展示评估函数、测试集及质量门禁。
- 负责智能体平台的工程师,需要在部署前检测版本回归并阻止关键指标下降。
- 进行上下文工程实验的团队,需要在相同测试集上比较不同上下文策略的质量、令牌消耗和效率。
- 构建研究或知识问答智能体的团队,需要分别评估事实准确性、完整性、引用准确性和来源质量。
- 运营生产智能体的团队,需要持续抽样交互、监控通过率,并对质量下降设置预警和临界告警。
- 管理会修改文件、数据库或配置的有状态智能体的工程师,需要通过程序化断言验证最终状态。
这个 Skill 有哪些优点和局限?
- 覆盖从测试集设计到生产监控的完整评估流程。
- 强调确定性验证优先于模型评判,可快速拦截结构性错误。
- 支持多维量规、复杂度分层、基线比较和最终状态断言。
- 明确讨论非确定性、指标作弊、测试集污染和评判偏差等风险。
- SKILL.md 中的代码主要是 Python 伪代码,并非可直接运行的评估框架。
- 没有提供具体领域的现成测试集、量规文件或执行器。
- 模型评判、人工复核和生产监控仍需要使用者自行实现和运营。
- 内容给出通用阈值示例,但实际阈值和权重必须按业务风险调整。
如何安装这个 Skill?
将仓库中的 skills/evaluation/ 整个目录复制到宿主支持的技能目录,保留其中的 SKILL.md 和相对路径。例如:mkdir -p .codex/skills && cp -R skills/evaluation .codex/skills/。也可复制到 .claude/skills/、.cursor/skills/ 或 .agents/skills/。不要把 SKILL.md 展平成单个文件。
如何使用这个 Skill?
在已加载该技能的兼容宿主中提出具体评估任务,例如:“为这个智能体流水线设计一个包含确定性检查、多维量规、复杂度分层测试集、基线比较和生产监控的评估框架。”随后根据任务提供真实使用样本、边界案例、预期结果和相关质量维度。该技能本身未提供专用运行命令或完整实现。