自动化与运维 ✓ Google · 官方 gkekubernetespod-disruption-budgetshealth-probestopology-spreadhigh-availability

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

FollowSkills 评估 · FSRS-2.0
不推荐
41/ 100 五分制 2.1 / 5
信任安全10 / 25 · 2.0/5

技能明确列出读取与应用 Kubernetes 资源的工具,未见凭据窃取、隐蔽外传或恶意行为;但 apply_k8s_manifest 可能产生外部变更,未要求用户确认、说明权限范围、数据流、敏感数据处理或提供回滚方案,因此扣分。

可靠稳定7 / 20 · 1.8/5

工作流和示例覆盖集群检查、PDB、探针、优雅终止、拓扑分布与副本数,快乐路径基本可理解;但文档表格存在明显格式损坏,依赖 MCP/gcloud/kubectl 的可用性未说明,缺少异常输入、失败反馈、验证步骤和一致性检查,因此按静态审查限制不超过10分并扣分。

适用触发8 / 15 · 2.7/5

触发场景和不适用范围较清楚,且覆盖常见 GKE 可靠性配置;但输入、输出和触发条件未形式化,未说明不同工作负载或现有架构下的边界,没有中文支持说明,且示例偏向特定区域和生产假设,因此扣分。

规范维护7 / 15 · 2.3/5

SKILL.md 结构清晰,具备元数据、工作流、示例和部分限制说明;README 提供安装方式,仓库提供 Apache-2.0 许可证并标注持续开发;但缺少技能自身版本、变更记录、明确维护责任、依赖安装说明、FAQ 和故障排查路径,因此扣分。

有效结果6 / 15 · 2.0/5

内容可直接用于形成部分 GKE 配置检查清单和 YAML 草案,具有明显实用价值;但若干“始终/每个生产工作负载”的建议过于绝对,未验证与具体应用、GKE 版本或现有资源的兼容性,也未提供完整端到端输出或执行确认,因此按静态审查限制不超过7分并扣分。

证据核验3 / 10 · 1.5/5

技能包含具体命令、资源类型和 YAML 示例,具备有限的审计线索;但提供材料中没有针对该技能的测试套件、CI 执行证据、结果样例或外部技术来源,官方发布者信息只能支持治理归属,不能替代可复现证据,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 应用 apply_k8s_manifest 前应由用户确认目标集群、命名空间、资源范围和变更内容,并准备可验证的回滚方案。
  • PDB、探针、拓扑约束和副本数建议需结合应用协议、容量、区域布局及 GKE/Kubernetes 版本验证,不能直接视为通用生产默认值。
  • 文档缺少异常场景、权限要求、依赖安装和执行后验证说明;中国大陆网络可达性与中文使用支持未说明。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 GKE 集群和工作负载的高可用与可靠性配置。它覆盖 PodDisruptionBudget、存活性探针、就绪探针、启动探针、优雅关闭、拓扑分布约束和副本数建议。技能提供区域集群、自动修复、自动升级及 SURGE 升级策略等可靠性默认值。它不用于灾难恢复或完整集群备份;该范围应使用 gke-backup-dr。

它通过 MCP 的 get_cluster 检查集群位置和节点分布,并可使用 gcloud 作为回退方案。它通过 get_k8s_resource 和 describe_k8s_resource 检查 PDB、Deployment 及健康探针,也可提供 kubectl 回退命令。它给出用于 PDB、探针、优雅关闭和拓扑分布约束的 Kubernetes YAML,并列出不同工作负载类型的最低副本数。SKILL.md 还列出 apply_k8s_manifest 和 list_k8s_events,但未提供具体调用示例。

  1. GKE 生产集群管理员需要确认控制平面是否为区域级、节点是否跨多个可用区。
  2. 平台工程师为拥有至少两个副本的生产 Deployment 配置 PDB,以应对节点升级或自动扩缩容缩容。
  3. 应用团队为生产容器补充存活性、就绪和启动探针,并明确设置探针超时参数。
  4. SRE 需要通过区域和节点拓扑分布约束降低单一区域或节点故障的影响。
  5. 服务团队需要配置 SIGTERM 处理、终止宽限期和 preStop 钩子,以便负载均衡器完成摘除。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖生产工作负载可靠性的多个关键配置面。
  • 提供可直接参考的 PDB、探针、优雅关闭和拓扑约束 YAML。
  • 同时给出 MCP 优先路径和 gcloud/kubectl 回退路径。
  • 明确说明适用范围,并排除灾难恢复和完整集群备份。
局限
  • 内容主要是参考配置和命令,未提供完整的自动化实施脚本。
  • MCP 服务、集群凭据和权限配置未在源材料中说明。
  • 未提供测试套件或平台验证证据。
  • 部分建议需要根据应用健康端点、启动时间和副本拓扑自行调整。

如何安装这个 Skill?

运行 npx skills add google/skills,然后从该仓库中选择 skills/cloud/gke-reliability。源材料未说明具体安装目录或客户端配置方式。该仓库整体采用 Apache-2.0 许可证。

如何使用这个 Skill?

在已安装该技能的 Agent Skills 客户端中提出具体请求,例如:“检查我的 GKE 集群是否具备区域级高可用,并为生产 Deployment 建议 PDB、健康探针和拓扑分布约束。”优先使用 SKILL.md 列出的 MCP 工具;没有 MCP 时,可按文档使用 gcloud 或 kubectl 回退命令。源材料未提供实际集群凭据、MCP 服务配置或完整执行流程。

这个 Skill 与同类方案有什么区别?

与 gke-backup-dr 相比,本技能关注工作负载高可用、探针、PDB 和拓扑分布,不覆盖灾难恢复或完整集群备份。与 gke-upgrades 的关系是,本技能建议在低流量时段安排升级,但升级专门流程属于 gke-upgrades。

常见问题

它会自动修改我的集群吗?
源材料提供了 apply_k8s_manifest 工具名称,但没有给出具体执行流程,因此不能确认安装后会自动修改集群。
使用它需要哪些工具?
文档优先列出 MCP 工具,并提供 gcloud 和 kubectl 作为回退命令。
它适合灾难恢复或集群备份吗?
不适合。SKILL.md 明确将灾难恢复和完整集群备份排除在外,并指向 gke-backup-dr。
它是否适合所有生产工作负载?
它覆盖常见生产可靠性配置,但副本数、探针参数和拓扑约束仍需依据具体应用行为调整。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

自动化与运维 ✓ Google · 官方

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

自动化与运维 ✓ Google · 官方

GKE 应用上云助手

帮助团队首次将应用容器化并部署到 Google Kubernetes Engine。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

自动化与运维 ✓ Google · 官方

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

自动化与运维 ✓ Google · 官方

GKE 存储管理

为 GKE 集群配置持久磁盘、Filestore 与 GCS FUSE 存储。

自动化与运维 ✓ Google · 官方

GKE 备份与灾难恢复

为有状态 GKE 工作负载配置备份策略与恢复流程。

自动化与运维 ✓ Google · 官方

GKE 工作负载安全

审计并强化 GKE 应用与命名空间的工作负载级安全控制。

自动化与运维 ✓ Google · 官方

Google Cloud 可靠性架构顾问

依据 Google Cloud Well-Architected Framework 评估并改进工作负载可靠性。

自动化与运维 ✓ Google · 官方

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

自动化与运维 ✓ Google · 官方

GKE 批处理与 HPC 工作负载

在 GKE 上配置、调度并运行批处理、并行计算和 HPC 作业。

自动化与运维 ✓ Google · 官方

GKE 平台安全加固

帮助平台团队规划并实施 GKE 集群级安全加固。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

相关 Skills