GKE 可观测性配置
为 GKE 配置日志、监控与 Prometheus 指标采集。
内容明确涉及日志、审计日志、指标和集群更新;提供了成本提示并限定了 GKE 范围,因此没有明显越权或隐蔽行为。扣分原因是更新命令使用 --quiet 且未要求用户确认、未说明所需权限、敏感日志处理、数据流、回滚或变更前备份,且默认启用全面遥测可能带来额外成本和数据暴露风险。
文档覆盖黄金路径、查询示例、成本降级和若干诊断场景,快乐路径看似可执行。扣分原因是未提供测试、输入校验、失败处理或诊断反馈;表格中的配置名与 CLI 参数存在潜在不一致(例如 APISERVER/API_SERVER、SYSTEM_COMPONENTS/SYSTEM),MCP 工具仅列名无参数和调用流程。静态评估按上限限制,不能证明超过中等可靠性。
触发条件和非适用范围写得清楚,覆盖 GKE logging、monitoring、Prometheus、kubectl 和 gcloud 场景。扣分原因是未明确输入、输出格式、权限前提、版本/集群类型边界,也没有中文支持说明;核心功能依赖 Google Cloud、GKE、gcloud、kubectl 和海外云服务,对中国大陆网络可达性未交代。
目录结构、名称、安装方式、许可证、支持入口和活动开发状态由仓库 README 提供;技能内有分节、示例、指标说明、成本和限制提示。扣分原因是该技能没有版本、变更日志、维护责任人或明确更新路径,依赖安装与版本要求不完整,MCP/CLI 分工说明不足,且部分 Markdown 表格格式异常。
技能能为 GKE 观测配置、日志查询、资源用量查看、告警和指标选择提供较直接的命令与建议,核心任务大体可完成。扣分原因是命令含未定义占位符,缺少执行前检查、结果验证、故障恢复和可直接交付的配置输出;全面默认方案的成本和适用性也可能需要较多人工复核。静态评估不能超过 7 分。
提供了具体 CLI 命令、指标名、查询语句和 Google 文档链接,具备一定可审计性。扣分原因是没有提交测试、CI、执行结果、版本锁定或第三方复现证据;链接未在本次静态审查中验证,因此无法支持更高分。
- 执行集群更新命令前应明确确认范围、权限、成本影响和回滚方案;--quiet 不等于安全确认。
- 应核对当前 GKE 版本和区域支持的监控参数,尤其是文档表格与 CLI 示例中的命名差异。
- 日志和审计日志可能包含敏感数据;应补充保留期、访问控制、脱敏和数据驻留说明。
- 对中国大陆用户,应验证 Google Cloud、gcloud、监控控制台和相关 API 的网络可达性。
这个 Skill 能做什么,适合哪些场景?
该技能面向 Google Kubernetes Engine,涵盖 Cloud Logging、Cloud Monitoring、托管式 Prometheus 和 Dataplane V2 流量指标。它提供一套包含控制平面指标的可观测性默认配置,并给出 gcloud、kubectl、Logging Query Language 和 MCP 工具的使用方式。内容还覆盖告警、节点健康评估、审计日志、成本控制以及生产环境中的 Cloud Trace 和 Cloud Profiler 建议。它不用于配置本地应用日志框架或 GKE 之外的外部 APM。
通过 GKE MCP 工具读取集群、Kubernetes 事件、日志、集群信息和资源描述;通过 gcloud container clusters update 启用系统、工作负载、控制平面、存储、Pod、GPU 等监控组件,以及托管式 Prometheus 和 Dataplane V2 可观测性指标;通过 gcloud logging read 查询系统、工作负载和审计日志;通过 kubectl top 查看 Pod、容器和节点的实时资源使用情况;提供指标查询、LQL 查询、告警阈值、节点健康指标和成本降低示例。
- GKE 平台工程师需要为生产集群启用完整监控套件,包括 API server、Scheduler 和 Controller Manager 指标。
- 运维人员需要查询特定集群、命名空间或容器的 Cloud Logging 日志。
- SRE 需要使用 Managed Prometheus 监控 Pod、节点、控制平面或 GPU 指标。
- 故障排查人员需要定位 OOMKilled、调度失败、API 延迟或节点未就绪问题。
- 团队需要在非生产环境将监控范围缩减为系统级指标以控制成本。
这个 Skill 有哪些优点和局限?
- 覆盖 GKE 日志、监控、指标、审计日志、告警和成本考虑。
- 默认配置明确包含 API server、Scheduler 和 Controller Manager 等控制平面指标。
- 同时提供 MCP、gcloud 和 kubectl 的操作边界与示例。
- 包含 Managed Prometheus、GPU、节点健康和常见故障排查指标。
- 内容聚焦 GKE 和 Google Cloud,不适用于本地日志框架或 GKE 外部 APM。
- 完整监控和日志采集可能产生 Cloud Logging、Cloud Monitoring 自定义指标及 Managed Prometheus 费用。
- 源材料没有提供测试套件、版本兼容矩阵或权限要求。
- Cloud Trace 和 Cloud Profiler 只是生产环境建议,并非黄金路径默认配置。
如何安装这个 Skill?
在支持 Agent Skills 的客户端中安装该仓库:npx skills add google/skills。安装过程中选择 gke-observability;源文件位于 skills/cloud/gke-observability/SKILL.md。该仓库包含 90 个独立技能,安装命令支持选择具体技能。
如何使用这个 Skill?
安装后,可使用类似“为我的 GKE 集群配置完整可观测性,包括 Cloud Logging、Cloud Monitoring、Managed Prometheus 和控制平面指标”的请求触发。也可以执行源文档中的 gcloud、kubectl 和 gcloud logging read 命令;集群查询和 Kubernetes 资源诊断可使用列出的 GKE MCP 工具。文档未规定客户端触发语法、权限配置或失败重试流程。