Google Cloud 智能体评测飞轮
用系统化评测、失败分析和迭代优化提升模型与智能体质量。
文档明确区分只读操作与会产生 LLM/远程计算费用的操作,并要求交互确认;部署前要求确认完整命令、缺失硬件参数时停止询问,也说明了 GCP 项目、认证、GCS、端点和远程沙箱等数据流。扣分在于依赖使用 >= 版本范围、未充分说明敏感评估数据处理、权限最小化、数据保留、部署回滚或取消机制;自定义本地代码以调用进程权限运行,风险提示有限。
主流程、脚本职责和异常反馈较清楚,包含输入校验、缺失依赖和常见 API 错误处理。扣分在于静态材料没有可执行复现证据;文档存在潜在不一致,如主文档使用 agentplatform/google.genai,而部分参考明确使用内部 import 路径,示例中的 rouge_l_sum 未出现在指标注册表;endpoint_evaluation.py 的返回类型标注也与实际返回对象不符,且关键脚本缺少提交的测试覆盖。
目标用户、评估场景、数据形状、指标选择和与 tuning/deploy 技能的边界描述较明确。扣分在于非适用场景、触发排除条件和版本兼容范围仍不完整;没有中文使用指导,并且核心能力依赖 Google Cloud、gcloud、GCS 和远程评估服务,对中国大陆网络与账号可达性未说明。
文档按主流程、参考资料和脚本分层,提供安装说明、数据结构、指标目录、示例、故障模式、限制提示、Apache-2.0 许可证、仓库支持入口和贡献路径。扣分在于该技能没有独立版本、变更记录、明确维护责任人或技能级更新策略;依赖版本范围较宽,内部 SDK 路径和示例稳定性说明不足。
五阶段飞轮、数据准备、推理、评分、失败分析和迭代比较覆盖了核心任务,并提供 JSON/HTML 结果持久化及辅助脚本,静态看具有直接操作价值。扣分在于没有文件内的真实执行结果、CI 测试或代表性输出证明;部分示例和 API 细节存在一致性疑点,用户可能需要额外校正后才能运行。
引用了 SDK 源码作为数据结构和指标注册表的来源,并提供了可审计的脚本、结果保存和前后比较流程;仓库修订和官方来源也支持基本追溯。扣分在于材料未提供已提交的测试套件、CI 执行记录或第三方复核结果,关键结论主要仍依赖文档示例,因此静态证据覆盖有限。
- 核心流程依赖 Google Cloud API、gcloud、GCS、认证和远程 LLM 评估服务;在中国大陆网络、区域、配额或账号条件下可能无法直接使用,部署或评估前应验证可达性与权限。
- 运行自定义本地指标代码会使用调用进程权限;评估数据可能包含会话轨迹或敏感内容,文档未给出脱敏、访问控制和保留策略。
- 应先核对 SDK 实际版本和公开 API;部分示例使用内部 import 路径,且 rouge_l_sum 与指标注册表不一致,不能仅凭文档假定可运行。
这个 Skill 能做什么,适合哪些场景?
该技能指导用户使用 Agent Platform GenAI Evaluation SDK 评估 Google Cloud 上的生成式 AI 模型和智能体。它覆盖评测数据集准备、推理、指标选择、结果分析以及修复后的前后对比。支持单轮模型评测、多轮智能体轨迹、合成用户场景、端点模型和 MaaS 模型。技能强调保存实际评测结果并据此验证改进,不能凭空声称分数或成功。
它可从 EvalCase 列表、pandas DataFrame、会话轨迹或服务器端合成场景创建 EvaluationDataset;调用 run_inference 填充模型响应或智能体轨迹;调用 evaluate 使用内置指标、LLM-as-a-judge、自定义代码或自定义函数评分;读取 summary_metrics 和 eval_case_results 分析失败;对大量失败生成损失聚类;保存 JSON 和 HTML 报告,并比较基线与候选结果以检测回归。它还提供用于验证数据集、解析 ADK 轨迹、检查结果、比较结果和渲染报告的脚本。
- Google Cloud 上的模型工程师需要为单轮问答建立评测数据集并选择通用质量、文本质量或指令遵循指标。
- 智能体开发者已有 ADK 会话轨迹,想评估任务成功率、轨迹质量和工具调用质量。
- 评测负责人没有现成数据,需要生成用户场景并让模拟用户驱动多轮评测。
- 团队修复提示词、编排或工具描述后,需要比较修复前后的分数并确认没有其他指标回归。
- 研究人员面对同一指标的十多个失败案例,需要用损失聚类识别共同失败主题。
这个 Skill 有哪些优点和局限?
- 提供从数据准备到回归检测的完整评测闭环。
- 同时覆盖单轮模型、多轮智能体、端点模型和 MaaS 模型。
- 包含内置指标、LLM-as-a-judge、自定义代码指标和失败聚类方法。
- 明确要求以实际 result 对象和前后对比作为成功证据。
- 依赖 Google Cloud 项目、区域和相关 SDK,不能脱离这些服务独立完成远程评测。
- run_inference、evaluate、场景生成和损失聚类会消耗计算资源并可能产生费用。
- 技能要求使用者处理数据集、凭据和云环境,但没有给出完整的权限配置清单。
- 源材料没有提供测试套件、支持平台清单或实际运行结果。
如何安装这个 Skill?
运行 npx skills add google/skills,然后在安装选择器中选择 skills/cloud/agent-platform-eval-flywheel。仓库说明了该集合的安装命令和选择方式,但没有规定所有客户端的具体安装目录或调用界面。使用 SDK 时安装 google-cloud-aiplatform[evaluation]>=1.154.0 和 google-genai>=1.0.0。
如何使用这个 Skill?
安装后,可提示:请使用 Agent Platform Eval Flywheel 评估我的智能体:先检查现有数据或 ADK 轨迹,选择合适指标,运行评测,分析失败,并比较修复前后的结果。执行会产生远程评测或推理成本的操作前,应先获得确认。准备 GOOGLE_CLOUD_PROJECT 和 GOOGLE_CLOUD_LOCATION`;若缺少这些变量,应先补充。首次评测按准备数据、运行推理、评分、分析失败、优化迭代五个阶段进行,并保存 JSON 与 HTML 结果。
这个 Skill 与同类方案有什么区别?
与同仓库中的 agent-platform-tuning 相比,本技能聚焦评测、失败分析和质量迭代,而不是微调;与 agent-platform-deploy 相比,本技能聚焦评测流程,而不是一般生产部署。