Vertex AI Agent 告警配置
为 Agent Runtime 智能体配置动态可靠性与质量告警。
证据显示技能要求对在线监视器、遥测和资源创建进行费用确认,并默认不配置通知渠道;但允许 Terraform、gcloud 和 Python 执行云端变更,要求动态覆盖项目内所有活跃代理,未充分说明最小权限、敏感追踪数据处理、完整数据流、通用回滚或部署前隔离,因此扣分。
文档明确了遥测检查、依赖安装、配置校验、自我修正和失败反馈流程;但关键脚本、requirements、references 及实际配置模板未提供,且静态阅读无法复现关键路径。部分规则还把必须先检查遥测与生成计划、必须配置六项策略等流程写得过于刚性,因此不超过静态上限并扣分。
技能明确限定 Agent Runtime,并区分可靠性、质量监控、无历史流量和不同流量模式,触发条件较清晰;但非适用边界、输入输出契约和中文支持不足,且核心能力依赖 Google Cloud、gcloud、Cloud Trace 和 Online Monitor,面向中国大陆网络的可达性未说明,因此扣分。
文档结构较完整,包含安全分级、算法映射、注意事项、依赖说明、示例命令、许可证元数据和官方链接;但版本、变更记录、维护负责人、更新路径、FAQ 以及引用的脚本和参考文件未在证据中给出,因此扣分。
文档提出动态基线、PromQL 可靠性策略和在线质量评估,理论上覆盖六类告警;但没有提交的 Terraform 输出、执行结果或测试证据,且质量监控依赖额外付费资源,静态证据不足以证明结果可直接使用,因此按静态上限保守扣分。
存在具体命令、指标名称、过滤器结构和 Google Cloud 官方文档链接,提供了有限的审计线索;但未提供测试套件、CI 结果、脚本内容或第三方执行证据,结论只能部分验证,因此扣分。
- 部署前应核实脚本、依赖、references 和 Terraform 模板确实存在,并审查 gcloud、Terraform 服务账号及其最小权限。
- 质量监控会产生额外费用并处理 Cloud Trace 数据;应明确数据保留、访问范围、采样和合规要求。
- 动态覆盖项目内所有活跃代理可能造成告警范围过宽;应在应用前确认资源范围、通知渠道、重复策略和可回滚方案。
- 应确认 Google Cloud 及相关 Online Monitor 服务在目标网络环境中可达,并补充中文用户的操作说明。
这个 Skill 能做什么,适合哪些场景?
该技能面向部署在 Google Cloud Vertex AI Agent Runtime 上的推理引擎智能体。它为延迟、错误率、最终响应质量、工具使用质量和幻觉配置六类告警策略。可靠性指标使用 PromQL 与动态基线,质量指标使用 Online Monitor 导出的评估分数。配置以 Terraform 文件生成,并可通过 Python 脚本检查遥测、分析重复配置和验证结果。
检查 Agent Runtime 推理引擎的遥测状态;根据流量模式选择延迟告警算法;为延迟和错误率生成 PromQL 告警,为质量指标生成 Cloud Monitoring 标准阈值告警;检查已有策略并验证 Terraform、PromQL 和 HCL;通过 Python 脚本创建 Online Monitor;输出 Terraform 配置文件。
- 需要监控生产 Agent Runtime 智能体延迟异常的 Google Cloud 运维团队。
- 希望用一小时和三天多窗口燃烧率监控错误率的可靠性工程师。
- 需要监控最终响应质量、工具使用质量和幻觉的 Agent 平台团队。
- 正在为新智能体启用 Cloud Trace 遥测和 Online Monitor 的平台工程师。
这个 Skill 有哪些优点和局限?
- 覆盖可靠性和质量两类监控,共六项明确指标。
- 针对 AI Agent 的动态流量特征使用历史基线,避免仅依赖固定阈值。
- 强制使用 Terraform 管理告警配置,并包含重复检查和配置验证流程。
- 支持多智能体动态聚合,不要求将策略固定到单个 Agent ID。
- 仅适用于 Agent Runtime,不适用于通用 GCP 告警或非 Agent GCP 告警。
- Online Monitor 和遥测会产生额外费用,且质量指标依赖遥测与在线评估数据。
- 缺少项目、资源路径或流量历史时,需要用户补充信息或采用默认流量模式。
- 源材料未说明测试套件、支持的 Terraform 版本或除指定工具外的运行环境。
如何安装这个 Skill?
在支持 Agent Skills 的客户端中运行:npx skills add google/skills。安装过程中选择 agent-platform-alert-configuration。源材料未说明该客户端之外的单独安装步骤。
如何使用这个 Skill?
向支持该技能的客户端提出类似请求:“为我的 Vertex AI Agent Runtime 推理引擎配置可靠性和质量告警。”使用时需提供项目 ID、完整的 Agent 资源路径(projects/<project_id>/locations/<location>/reasoningEngines/<agent_id>)以及必要的 Terraform 工作区信息。若要创建 Online Monitor 或启用遥测,应先确认额外费用;源材料未提供无参数即可直接执行的完整命令。
这个 Skill 与同类方案有什么区别?
该技能明确将动态 PromQL 基线与静态阈值进行区分,并要求可靠性指标使用 PromQL、质量指标使用标准阈值过滤器;它不是通用 GCP 告警配置工具。