自动化与运维 ✓ Google · 官方 gkecloud-monitoringcloud-loggingmanaged-prometheuskubernetesobservability

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

FollowSkills 评估 · FSRS-2.0
不推荐
44/ 100 五分制 2.2 / 5
信任安全10 / 25 · 2.0/5

内容明确涉及日志、审计日志、指标和集群更新;提供了成本提示并限定了 GKE 范围,因此没有明显越权或隐蔽行为。扣分原因是更新命令使用 --quiet 且未要求用户确认、未说明所需权限、敏感日志处理、数据流、回滚或变更前备份,且默认启用全面遥测可能带来额外成本和数据暴露风险。

可靠稳定7 / 20 · 1.8/5

文档覆盖黄金路径、查询示例、成本降级和若干诊断场景,快乐路径看似可执行。扣分原因是未提供测试、输入校验、失败处理或诊断反馈;表格中的配置名与 CLI 参数存在潜在不一致(例如 APISERVER/API_SERVER、SYSTEM_COMPONENTS/SYSTEM),MCP 工具仅列名无参数和调用流程。静态评估按上限限制,不能证明超过中等可靠性。

适用触发9 / 15 · 3.0/5

触发条件和非适用范围写得清楚,覆盖 GKE logging、monitoring、Prometheus、kubectl 和 gcloud 场景。扣分原因是未明确输入、输出格式、权限前提、版本/集群类型边界,也没有中文支持说明;核心功能依赖 Google Cloud、GKE、gcloud、kubectl 和海外云服务,对中国大陆网络可达性未交代。

规范维护8 / 15 · 2.7/5

目录结构、名称、安装方式、许可证、支持入口和活动开发状态由仓库 README 提供;技能内有分节、示例、指标说明、成本和限制提示。扣分原因是该技能没有版本、变更日志、维护责任人或明确更新路径,依赖安装与版本要求不完整,MCP/CLI 分工说明不足,且部分 Markdown 表格格式异常。

有效结果6 / 15 · 2.0/5

技能能为 GKE 观测配置、日志查询、资源用量查看、告警和指标选择提供较直接的命令与建议,核心任务大体可完成。扣分原因是命令含未定义占位符,缺少执行前检查、结果验证、故障恢复和可直接交付的配置输出;全面默认方案的成本和适用性也可能需要较多人工复核。静态评估不能超过 7 分。

证据核验4 / 10 · 2.0/5

提供了具体 CLI 命令、指标名、查询语句和 Google 文档链接,具备一定可审计性。扣分原因是没有提交测试、CI、执行结果、版本锁定或第三方复现证据;链接未在本次静态审查中验证,因此无法支持更高分。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行集群更新命令前应明确确认范围、权限、成本影响和回滚方案;--quiet 不等于安全确认。
  • 应核对当前 GKE 版本和区域支持的监控参数,尤其是文档表格与 CLI 示例中的命名差异。
  • 日志和审计日志可能包含敏感数据;应补充保留期、访问控制、脱敏和数据驻留说明。
  • 对中国大陆用户,应验证 Google Cloud、gcloud、监控控制台和相关 API 的网络可达性。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 Google Kubernetes Engine,涵盖 Cloud Logging、Cloud Monitoring、托管式 Prometheus 和 Dataplane V2 流量指标。它提供一套包含控制平面指标的可观测性默认配置,并给出 gcloud、kubectl、Logging Query Language 和 MCP 工具的使用方式。内容还覆盖告警、节点健康评估、审计日志、成本控制以及生产环境中的 Cloud Trace 和 Cloud Profiler 建议。它不用于配置本地应用日志框架或 GKE 之外的外部 APM。

通过 GKE MCP 工具读取集群、Kubernetes 事件、日志、集群信息和资源描述;通过 gcloud container clusters update 启用系统、工作负载、控制平面、存储、Pod、GPU 等监控组件,以及托管式 Prometheus 和 Dataplane V2 可观测性指标;通过 gcloud logging read 查询系统、工作负载和审计日志;通过 kubectl top 查看 Pod、容器和节点的实时资源使用情况;提供指标查询、LQL 查询、告警阈值、节点健康指标和成本降低示例。

  1. GKE 平台工程师需要为生产集群启用完整监控套件,包括 API server、Scheduler 和 Controller Manager 指标。
  2. 运维人员需要查询特定集群、命名空间或容器的 Cloud Logging 日志。
  3. SRE 需要使用 Managed Prometheus 监控 Pod、节点、控制平面或 GPU 指标。
  4. 故障排查人员需要定位 OOMKilled、调度失败、API 延迟或节点未就绪问题。
  5. 团队需要在非生产环境将监控范围缩减为系统级指标以控制成本。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 GKE 日志、监控、指标、审计日志、告警和成本考虑。
  • 默认配置明确包含 API server、Scheduler 和 Controller Manager 等控制平面指标。
  • 同时提供 MCP、gcloud 和 kubectl 的操作边界与示例。
  • 包含 Managed Prometheus、GPU、节点健康和常见故障排查指标。
局限
  • 内容聚焦 GKE 和 Google Cloud,不适用于本地日志框架或 GKE 外部 APM。
  • 完整监控和日志采集可能产生 Cloud Logging、Cloud Monitoring 自定义指标及 Managed Prometheus 费用。
  • 源材料没有提供测试套件、版本兼容矩阵或权限要求。
  • Cloud Trace 和 Cloud Profiler 只是生产环境建议,并非黄金路径默认配置。

如何安装这个 Skill?

在支持 Agent Skills 的客户端中安装该仓库:npx skills add google/skills。安装过程中选择 gke-observability;源文件位于 skills/cloud/gke-observability/SKILL.md。该仓库包含 90 个独立技能,安装命令支持选择具体技能。

如何使用这个 Skill?

安装后,可使用类似“为我的 GKE 集群配置完整可观测性,包括 Cloud Logging、Cloud Monitoring、Managed Prometheus 和控制平面指标”的请求触发。也可以执行源文档中的 gcloud、kubectl 和 gcloud logging read 命令;集群查询和 Kubernetes 资源诊断可使用列出的 GKE MCP 工具。文档未规定客户端触发语法、权限配置或失败重试流程。

常见问题

这个技能会自动配置所有 GKE 可观测性吗?
它提供配置说明和可复制的 gcloud、kubectl 命令,并列出 MCP 工具;源材料没有证明客户端会自动执行所有操作。
使用完整配置会产生费用吗?
可能会。Cloud Logging 超出每项目每月 50 GiB 免费额度后收费,Cloud Monitoring 自定义指标按时间序列收费,Managed Prometheus 按摄取样本收费。
它能处理外部 APM 或本地应用日志框架吗?
不能。描述明确将本地应用日志框架和 GKE 外部的外部 APM 排除在适用范围之外。
实时资源使用量通过什么方式查看?
使用 kubectl top 查看 Pod、容器和节点;文档明确说明没有对应的 MCP 或 gcloud 等价方式。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

自动化与运维 ✓ Google · 官方

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

自动化与运维 ✓ Google · 官方

GKE 应用上云助手

帮助团队首次将应用容器化并部署到 Google Kubernetes Engine。

自动化与运维 ✓ Google · 官方

GKE 存储管理

为 GKE 集群配置持久磁盘、Filestore 与 GCS FUSE 存储。

自动化与运维 ✓ Google · 官方

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

自动化与运维 ✓ Google · 官方

GKE 备份与灾难恢复

为有状态 GKE 工作负载配置备份策略与恢复流程。

开发与工程 ✓ Google · 官方

Google Agents CLI 智能体开发引导

引导智能体从设计、开发到部署与监控的完整流程。

自动化与运维 ✓ Google · 官方

Google Cloud 基础落地区构建器

为 Google Cloud 组织部署安全的企业级基础落地区。

自动化与运维 ✓ Google · 官方

Google Cloud 可靠性架构顾问

依据 Google Cloud Well-Architected Framework 评估并改进工作负载可靠性。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

自动化与运维 ✓ Google · 官方

Google Cloud 运营卓越顾问

依据 Google Cloud WAF 评估并改进工作负载运营实践。

相关 Skills