数据与分析 ✓ Google · 官方 google-cloudagent-evaluationevaluation-datasetsllm-as-judgefailure-analysispython-sdkmodel-comparison

Google Cloud 智能体评测飞轮

用系统化评测、失败分析和迭代优化提升模型与智能体质量。

FollowSkills 评估 · FSRS-2.0
不推荐
51/ 100 五分制 2.6 / 5
信任安全17 / 25 · 3.4/5

文档明确区分只读操作与会产生 LLM/远程计算费用的操作,并要求交互确认;部署前要求确认完整命令、缺失硬件参数时停止询问,也说明了 GCP 项目、认证、GCS、端点和远程沙箱等数据流。扣分在于依赖使用 >= 版本范围、未充分说明敏感评估数据处理、权限最小化、数据保留、部署回滚或取消机制;自定义本地代码以调用进程权限运行,风险提示有限。

可靠稳定6 / 20 · 1.5/5

主流程、脚本职责和异常反馈较清楚,包含输入校验、缺失依赖和常见 API 错误处理。扣分在于静态材料没有可执行复现证据;文档存在潜在不一致,如主文档使用 agentplatform/google.genai,而部分参考明确使用内部 import 路径,示例中的 rouge_l_sum 未出现在指标注册表;endpoint_evaluation.py 的返回类型标注也与实际返回对象不符,且关键脚本缺少提交的测试覆盖。

适用触发8 / 15 · 2.7/5

目标用户、评估场景、数据形状、指标选择和与 tuning/deploy 技能的边界描述较明确。扣分在于非适用场景、触发排除条件和版本兼容范围仍不完整;没有中文使用指导,并且核心能力依赖 Google Cloud、gcloud、GCS 和远程评估服务,对中国大陆网络与账号可达性未说明。

规范维护10 / 15 · 3.3/5

文档按主流程、参考资料和脚本分层,提供安装说明、数据结构、指标目录、示例、故障模式、限制提示、Apache-2.0 许可证、仓库支持入口和贡献路径。扣分在于该技能没有独立版本、变更记录、明确维护责任人或技能级更新策略;依赖版本范围较宽,内部 SDK 路径和示例稳定性说明不足。

有效结果6 / 15 · 2.0/5

五阶段飞轮、数据准备、推理、评分、失败分析和迭代比较覆盖了核心任务,并提供 JSON/HTML 结果持久化及辅助脚本,静态看具有直接操作价值。扣分在于没有文件内的真实执行结果、CI 测试或代表性输出证明;部分示例和 API 细节存在一致性疑点,用户可能需要额外校正后才能运行。

证据核验4 / 10 · 2.0/5

引用了 SDK 源码作为数据结构和指标注册表的来源,并提供了可审计的脚本、结果保存和前后比较流程;仓库修订和官方来源也支持基本追溯。扣分在于材料未提供已提交的测试套件、CI 执行记录或第三方复核结果,关键结论主要仍依赖文档示例,因此静态证据覆盖有限。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 核心流程依赖 Google Cloud API、gcloud、GCS、认证和远程 LLM 评估服务;在中国大陆网络、区域、配额或账号条件下可能无法直接使用,部署或评估前应验证可达性与权限。
  • 运行自定义本地指标代码会使用调用进程权限;评估数据可能包含会话轨迹或敏感内容,文档未给出脱敏、访问控制和保留策略。
  • 应先核对 SDK 实际版本和公开 API;部分示例使用内部 import 路径,且 rouge_l_sum 与指标注册表不一致,不能仅凭文档假定可运行。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导用户使用 Agent Platform GenAI Evaluation SDK 评估 Google Cloud 上的生成式 AI 模型和智能体。它覆盖评测数据集准备、推理、指标选择、结果分析以及修复后的前后对比。支持单轮模型评测、多轮智能体轨迹、合成用户场景、端点模型和 MaaS 模型。技能强调保存实际评测结果并据此验证改进,不能凭空声称分数或成功。

它可从 EvalCase 列表、pandas DataFrame、会话轨迹或服务器端合成场景创建 EvaluationDataset;调用 run_inference 填充模型响应或智能体轨迹;调用 evaluate 使用内置指标、LLM-as-a-judge、自定义代码或自定义函数评分;读取 summary_metrics 和 eval_case_results 分析失败;对大量失败生成损失聚类;保存 JSON 和 HTML 报告,并比较基线与候选结果以检测回归。它还提供用于验证数据集、解析 ADK 轨迹、检查结果、比较结果和渲染报告的脚本。

  1. Google Cloud 上的模型工程师需要为单轮问答建立评测数据集并选择通用质量、文本质量或指令遵循指标。
  2. 智能体开发者已有 ADK 会话轨迹,想评估任务成功率、轨迹质量和工具调用质量。
  3. 评测负责人没有现成数据,需要生成用户场景并让模拟用户驱动多轮评测。
  4. 团队修复提示词、编排或工具描述后,需要比较修复前后的分数并确认没有其他指标回归。
  5. 研究人员面对同一指标的十多个失败案例,需要用损失聚类识别共同失败主题。

这个 Skill 有哪些优点和局限?

优点
  • 提供从数据准备到回归检测的完整评测闭环。
  • 同时覆盖单轮模型、多轮智能体、端点模型和 MaaS 模型。
  • 包含内置指标、LLM-as-a-judge、自定义代码指标和失败聚类方法。
  • 明确要求以实际 result 对象和前后对比作为成功证据。
局限
  • 依赖 Google Cloud 项目、区域和相关 SDK,不能脱离这些服务独立完成远程评测。
  • run_inference、evaluate、场景生成和损失聚类会消耗计算资源并可能产生费用。
  • 技能要求使用者处理数据集、凭据和云环境,但没有给出完整的权限配置清单。
  • 源材料没有提供测试套件、支持平台清单或实际运行结果。

如何安装这个 Skill?

运行 npx skills add google/skills,然后在安装选择器中选择 skills/cloud/agent-platform-eval-flywheel。仓库说明了该集合的安装命令和选择方式,但没有规定所有客户端的具体安装目录或调用界面。使用 SDK 时安装 google-cloud-aiplatform[evaluation]>=1.154.0google-genai>=1.0.0

如何使用这个 Skill?

安装后,可提示:请使用 Agent Platform Eval Flywheel 评估我的智能体:先检查现有数据或 ADK 轨迹,选择合适指标,运行评测,分析失败,并比较修复前后的结果。执行会产生远程评测或推理成本的操作前,应先获得确认。准备 GOOGLE_CLOUD_PROJECTGOOGLE_CLOUD_LOCATION`;若缺少这些变量,应先补充。首次评测按准备数据、运行推理、评分、分析失败、优化迭代五个阶段进行,并保存 JSON 与 HTML 结果。

这个 Skill 与同类方案有什么区别?

与同仓库中的 agent-platform-tuning 相比,本技能聚焦评测、失败分析和质量迭代,而不是微调;与 agent-platform-deploy 相比,本技能聚焦评测流程,而不是一般生产部署。

常见问题

使用它会产生费用吗?
可能会。运行推理、评测、用户场景生成和损失聚类会调用 LLM 或远程评测服务并消耗计算资源,因此执行这些操作前需要交互式确认。
它需要哪些环境信息?
需要 `GOOGLE_CLOUD_PROJECT` 和 `GOOGLE_CLOUD_LOCATION`。源材料没有列出完整的 IAM 权限要求。
没有评测数据可以开始吗?
可以。技能支持通过 `client.evals.generate_user_scenarios(...)` 在服务端生成用户场景,然后运行推理和评测。
它能直接证明模型已经变好吗?
只有在读取实际评测结果、检查所有案例并使用比较脚本确认目标指标提升且没有其他指标回归时,才能作出这种结论。

同仓库的其他 Skills

均来自 google/skills

开发与工程 ✓ Google · 官方

Agent Platform 提示词管理

用 Python 管理 Agent Platform 中的托管提示词。

开发与工程 ✓ Google · 官方

Agent Platform 调优任务管理

用 Python SDK 查看、查询并取消 Agent Platform 调优任务。

数据与分析 ✓ Google · 官方

Agent Platform RAG 引擎管理

用 Vertex AI Python SDK 管理语料库并检索可用于生成的依据。

自动化与运维 ✓ Google · 官方

Google Cloud AI Agent 构建部署顾问

帮助设计、实现并验证部署在 Google Cloud 上的 AI Agent 与多 Agent 系统。

开发与工程 ✓ Google · 官方

Gemini API 企业开发指南

帮助开发者使用统一 Gen AI SDK 在 Gemini Enterprise Agent Platform 上构建企业级 Gemini 应用。

数据与分析 ✓ Google · 官方

Agent Platform 模型注册表管理

用 gcloud 管理 Agent Platform 中的模型、版本及其元数据。

开发与工程 ✓ Google · 官方

Google Cloud Agent Platform 推理助手

帮助开发者连接 Google Cloud Agent Platform 并调用 Gemini 与 OpenMaaS 模型。

数据与分析 ✓ Google · 官方

Agent Platform 模型调优

指导你使用 Google Agent Platform 为 Open Model 或 Gemini Model 完成端到端微调。

自动化与运维 ✓ Google · 官方

Agent Platform 模型部署助手

在 Google Agent Platform 上部署、验证并清理 Model Garden 模型。

自动化与运维 ✓ Google · 官方

Google Cloud 解决方案架构师

从需求发现到验证交付,规划复杂 Google Cloud 多产品工作负载。

自动化与运维 ✓ Google · 官方

Google Cloud Workload Manager 评估助手

用 Workload Manager 检查 Google Cloud 工作负载的最佳实践合规性。

自动化与运维 ✓ Google · 官方

Google Cloud 实时多模态流解决方案助手

为实时双向多模态流工作负载设计并部署 Google Cloud 方案。

自动化与运维 ✓ Google · 官方

Google Cloud 运营卓越顾问

依据 Google Cloud WAF 评估并改进工作负载运营实践。

自动化与运维 ✓ Google · 官方

Agent Platform 端点管理

管理 Agent Platform 在线预测服务端点及其常见故障。

开发与工程 ✓ Google · 官方

Gemini 交互式对话 API 指南

在 Google Agent Platform 上构建有状态、多轮的 Gemini 交互。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

开发与工程 ✓ Google · 官方

Google Agents CLI 智能体开发引导

引导智能体从设计、开发到部署与监控的完整流程。

开发与工程 ✓ Google · 官方

Gemini 企业代理技能注册中心

帮助代理搜索、管理并生成 Gemini Enterprise Agent Platform 技能。

开发与工程 ✓ Google · 官方

Gemini 企业托管 Agent 管理

通过 API 创建和管理有状态的 Gemini 企业 Agent。

自动化与运维 ✓ Google · 官方

Gemini AI Studio 迁移至 Agent Platform

帮助应用从 Gemini API 的 AI Studio 环境迁移到 Google Cloud Agent Platform。

相关 Skills