自动化与运维 ✓ Google · 官方 google-cloudvertex-aialerting-policiesprometheusterraformonline-monitoringtelemetry

Vertex AI Agent 告警配置

为 Agent Runtime 智能体配置动态可靠性与质量告警。

FollowSkills 评估 · FSRS-2.0
不推荐
40/ 100 五分制 2.0 / 5
信任安全10 / 25 · 2.0/5

证据显示技能要求对在线监视器、遥测和资源创建进行费用确认,并默认不配置通知渠道;但允许 Terraform、gcloud 和 Python 执行云端变更,要求动态覆盖项目内所有活跃代理,未充分说明最小权限、敏感追踪数据处理、完整数据流、通用回滚或部署前隔离,因此扣分。

可靠稳定6 / 20 · 1.5/5

文档明确了遥测检查、依赖安装、配置校验、自我修正和失败反馈流程;但关键脚本、requirements、references 及实际配置模板未提供,且静态阅读无法复现关键路径。部分规则还把必须先检查遥测与生成计划、必须配置六项策略等流程写得过于刚性,因此不超过静态上限并扣分。

适用触发9 / 15 · 3.0/5

技能明确限定 Agent Runtime,并区分可靠性、质量监控、无历史流量和不同流量模式,触发条件较清晰;但非适用边界、输入输出契约和中文支持不足,且核心能力依赖 Google Cloud、gcloud、Cloud Trace 和 Online Monitor,面向中国大陆网络的可达性未说明,因此扣分。

规范维护7 / 15 · 2.3/5

文档结构较完整,包含安全分级、算法映射、注意事项、依赖说明、示例命令、许可证元数据和官方链接;但版本、变更记录、维护负责人、更新路径、FAQ 以及引用的脚本和参考文件未在证据中给出,因此扣分。

有效结果5 / 15 · 1.7/5

文档提出动态基线、PromQL 可靠性策略和在线质量评估,理论上覆盖六类告警;但没有提交的 Terraform 输出、执行结果或测试证据,且质量监控依赖额外付费资源,静态证据不足以证明结果可直接使用,因此按静态上限保守扣分。

证据核验3 / 10 · 1.5/5

存在具体命令、指标名称、过滤器结构和 Google Cloud 官方文档链接,提供了有限的审计线索;但未提供测试套件、CI 结果、脚本内容或第三方执行证据,结论只能部分验证,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 部署前应核实脚本、依赖、references 和 Terraform 模板确实存在,并审查 gcloud、Terraform 服务账号及其最小权限。
  • 质量监控会产生额外费用并处理 Cloud Trace 数据;应明确数据保留、访问范围、采样和合规要求。
  • 动态覆盖项目内所有活跃代理可能造成告警范围过宽;应在应用前确认资源范围、通知渠道、重复策略和可回滚方案。
  • 应确认 Google Cloud 及相关 Online Monitor 服务在目标网络环境中可达,并补充中文用户的操作说明。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向部署在 Google Cloud Vertex AI Agent Runtime 上的推理引擎智能体。它为延迟、错误率、最终响应质量、工具使用质量和幻觉配置六类告警策略。可靠性指标使用 PromQL 与动态基线,质量指标使用 Online Monitor 导出的评估分数。配置以 Terraform 文件生成,并可通过 Python 脚本检查遥测、分析重复配置和验证结果。

检查 Agent Runtime 推理引擎的遥测状态;根据流量模式选择延迟告警算法;为延迟和错误率生成 PromQL 告警,为质量指标生成 Cloud Monitoring 标准阈值告警;检查已有策略并验证 Terraform、PromQL 和 HCL;通过 Python 脚本创建 Online Monitor;输出 Terraform 配置文件。

  1. 需要监控生产 Agent Runtime 智能体延迟异常的 Google Cloud 运维团队。
  2. 希望用一小时和三天多窗口燃烧率监控错误率的可靠性工程师。
  3. 需要监控最终响应质量、工具使用质量和幻觉的 Agent 平台团队。
  4. 正在为新智能体启用 Cloud Trace 遥测和 Online Monitor 的平台工程师。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖可靠性和质量两类监控,共六项明确指标。
  • 针对 AI Agent 的动态流量特征使用历史基线,避免仅依赖固定阈值。
  • 强制使用 Terraform 管理告警配置,并包含重复检查和配置验证流程。
  • 支持多智能体动态聚合,不要求将策略固定到单个 Agent ID。
局限
  • 仅适用于 Agent Runtime,不适用于通用 GCP 告警或非 Agent GCP 告警。
  • Online Monitor 和遥测会产生额外费用,且质量指标依赖遥测与在线评估数据。
  • 缺少项目、资源路径或流量历史时,需要用户补充信息或采用默认流量模式。
  • 源材料未说明测试套件、支持的 Terraform 版本或除指定工具外的运行环境。

如何安装这个 Skill?

在支持 Agent Skills 的客户端中运行:npx skills add google/skills。安装过程中选择 agent-platform-alert-configuration。源材料未说明该客户端之外的单独安装步骤。

如何使用这个 Skill?

向支持该技能的客户端提出类似请求:“为我的 Vertex AI Agent Runtime 推理引擎配置可靠性和质量告警。”使用时需提供项目 ID、完整的 Agent 资源路径(projects/<project_id>/locations/<location>/reasoningEngines/<agent_id>)以及必要的 Terraform 工作区信息。若要创建 Online Monitor 或启用遥测,应先确认额外费用;源材料未提供无参数即可直接执行的完整命令。

这个 Skill 与同类方案有什么区别?

该技能明确将动态 PromQL 基线与静态阈值进行区分,并要求可靠性指标使用 PromQL、质量指标使用标准阈值过滤器;它不是通用 GCP 告警配置工具。

常见问题

它能配置普通 Google Cloud Monitoring 告警吗?
不能。源材料明确限定为 Agent Runtime 上的 Vertex AI / Agent Platform 智能体。
使用质量告警会产生费用吗?
会。Online Monitor 和遥测都有额外费用,创建前必须取得用户确认。
需要哪些工具?
源材料显示需要 Terraform、Google Cloud CLI 和 Python 3;脚本还要求先安装 scripts/requirements.txt 中的依赖。
没有历史流量数据怎么办?
技能要求询问预期流量模式:Steady、Seasonal 或 Bursty;若要求立即设置,则使用 Steady/Consistent 默认模式。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

Google Cloud 实时多模态流解决方案助手

为实时双向多模态流工作负载设计并部署 Google Cloud 方案。

自动化与运维 ✓ Google · 官方

Google Cloud AI Agent 构建部署顾问

帮助设计、实现并验证部署在 Google Cloud 上的 AI Agent 与多 Agent 系统。

开发与工程 ✓ Google · 官方

Gemini LiveAPI 客户端服务技能

生成可断线恢复并支持多模态双向流式通信的 Gemini LiveAPI 客户端。

数据与分析 ✓ Google · 官方

Agent Platform RAG 引擎管理

用 Vertex AI Python SDK 管理语料库并检索可用于生成的依据。

开发与工程 ✓ Google · 官方

Google Cloud Agent Platform 推理助手

帮助开发者连接 Google Cloud Agent Platform 并调用 Gemini 与 OpenMaaS 模型。

开发与工程 ✓ Google · 官方

Google Agents CLI 智能体开发引导

引导智能体从设计、开发到部署与监控的完整流程。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

数据与分析 ✓ Google · 官方

AlloyDB 数据库管理助手

帮助管理 AlloyDB 集群、实例与备份,并连接 MCP 自动执行数据库操作。

自动化与运维 ✓ Google · 官方

Google Cloud 全球外部应用负载均衡配置

以最佳实践配置并部署 Google Cloud 全球外部应用负载均衡器。

数据与分析 ✓ Google · 官方

Google Cloud 无边界开放数据湖仓设计技能

帮助设计连接多云数据孤岛与智能体的受治理数据湖仓。

自动化与运维 ✓ Google · 官方

Google Cloud 安全无服务器分层架构

帮助代理设计、编写基础设施代码并验证隔离的 Google Cloud 多层无服务器 Web 应用。

自动化与运维 ✓ Google · 官方

Google Cloud 基础落地区构建器

为 Google Cloud 组织部署安全的企业级基础落地区。

自动化与运维 ✓ Google · 官方

Google Cloud Storage 基础技能

帮助代理管理 GCS 存储桶与对象,并配置访问、保护、生命周期和性能。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

开发与工程 ✓ Google · 官方

Gemini API 企业开发指南

帮助开发者使用统一 Gen AI SDK 在 Gemini Enterprise Agent Platform 上构建企业级 Gemini 应用。

自动化与运维 ✓ Google · 官方

Google Cloud 监控指标选择器

为 GCP 服务发现并筛选相关监控指标。

自动化与运维 ✓ Google · 官方

Google Cloud 身份认证指南

帮助代理为不同运行环境选择安全的 Google Cloud 认证与授权方案。

自动化与运维 ✓ Google · 官方

Google Cloud 解决方案架构师

从需求发现到验证交付,规划复杂 Google Cloud 多产品工作负载。

自动化与运维 ✓ Google · 官方

Google Cloud 可靠性架构顾问

依据 Google Cloud Well-Architected Framework 评估并改进工作负载可靠性。

自动化与运维 ✓ Google · 官方

Google Cloud Workload Manager 评估助手

用 Workload Manager 检查 Google Cloud 工作负载的最佳实践合规性。

相关 Skills