自动化与运维 ✓ Google · 官方 gke-upgradeskubernetes-maintenancenode-pool-upgradesmaintenance-exclusionsrelease-channelsgpu-clustersupgrade-troubleshooting

GKE 升级与维护顾问

为 Standard 和 Autopilot GKE 集群制定并验证升级与维护方案。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全13 / 25 · 2.6/5

证据显示覆盖了维护排除、版本偏差、回滚、区域集群、PDB、GPU和凭据轮换等风险,并提供部分恢复路径;但没有明确要求用户确认高影响操作,也未充分说明命令的数据流、权限边界或敏感信息处理。故扣分于最小权限、确认机制和操作前后保护不足。

可靠稳定7 / 20 · 1.8/5

文档结构完整,包含前置检查、升级、验证、回滚和故障诊断路径;但静态阅读无法复现关键路径,部分故障修复直接建议删除裸 Pod、删除 Webhook 或放宽 PDB,缺少充分的条件检查、备份确认和失败反馈。按静态校准不超过10,故扣分于边界和异常处理证据不足。

适用触发9 / 15 · 3.0/5

触发条件、Standard/Autopilot 区分、版本、频道、工作负载和不适用范围描述较清楚;但没有中文输出或中国大陆网络可达性说明,且许多建议依赖 gcloud、kubectl、GKE 控制面和 Google Cloud 文档。故扣分于语言、网络环境和部署前提未声明。

规范维护9 / 15 · 3.0/5

具有 front matter、分层章节、引用的模板文件、命令示例、检查清单、限制说明和 Apache-2.0 许可;仓库 README 表明项目持续开发并提供安装和 issue 路径。但选定技能自身没有版本号、变更记录、明确维护责任人或更新策略。故扣分于版本治理和维护责任不完整。

有效结果6 / 15 · 2.0/5

目标输出明确,模板和命令可直接改写为升级计划、检查清单和运行手册,覆盖常见工作负载与故障类型;但需要用户环境信息和人工核验,且若干高风险修复建议可能需要大量审查,静态证据不能证明结果正确性。按静态校准不超过7,故扣分于直接可用性和验证充分度。

证据核验4 / 10 · 2.0/5

提供了 GKE Release Notes、升级、维护排除和 Rollout Sequencing 等官方参考链接,且命令、清单和诊断步骤可审计;但没有提交的测试套件、CI 覆盖或第三方执行证据,且无法在本次静态审查中独立复现。按静态校准不超过5,故扣分于复现和交叉证据不足。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 删除裸 Pod、删除准入 Webhook、临时放宽 PDB 和凭据轮换等命令可能造成业务中断或安全影响;执行前应核实对象、备份配置并取得用户确认。
  • 文档依赖 Google Cloud/GKE 服务及海外文档访问,未说明中国大陆网络可达性或离线替代方案。
  • 升级版本、gcloud 参数和 GKE 行为可能随时间变化;应以目标环境中对应版本的官方文档和实际 CLI 帮助为准。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能专注于 Google Kubernetes Engine 集群升级和维护,覆盖 Standard 与 Autopilot 模式。它会根据版本、发布渠道、环境拓扑和工作负载生成升级计划、检查清单、维护运行手册及故障排查指南。内容涵盖控制平面与节点池升级、维护窗口和排除项、发布渠道、PDB、状态型工作负载及 GPU 集群。它适合需要规范化 GKE 生命周期管理的团队,但不负责集群创建、应用接入、通用网络配置或安全策略配置。

在制定升级材料前收集集群模式、当前和目标版本、发布渠道、环境分层、Rollout Sequencing 使用情况及工作负载类型。它区分主版本、次版本和补丁升级,规划控制平面与节点池的升级顺序,并针对 Standard 集群提出 Surge 或 Blue-Green 策略。它生成包含 gcloud 和 kubectl 命令的维护运行手册,以及可复制的升级前后检查清单;还会分析 PDB、资源容量、裸 Pod、准入 Webhook 和 PVC 附加问题。对于 GPU/TPU 集群,它处理无实时迁移、固定配额、驱动与 CUDA 兼容性及切换风险。

  1. 平台团队需要为开发、预发布和生产 GKE 集群规划分阶段版本升级。
  2. 运维人员需要配置维护窗口、自动升级排除项或发布渠道。
  3. Standard 集群需要为无状态、数据库或 GPU 节点池选择升级策略和顺序。
  4. 团队遇到升级停滞、PDB 阻塞、资源不足、Webhook 拒绝或 PVC 附加失败。
  5. GPU 训练集群需要在维护期间控制自动升级并验证新的驱动和 CUDA 兼容性。

这个 Skill 有哪些优点和局限?

优点
  • 同时覆盖 Standard 和 Autopilot 集群。
  • 强调自动升级、维护窗口、发布渠道和环境分阶段推进。
  • 包含状态型、GPU、批处理和 Operator 工作负载的专门注意事项。
  • 可生成包含 gcloud、kubectl 命令的运行手册和检查清单。
  • 系统覆盖升级停滞的五类常见原因。
局限
  • 需要用户提供或确认集群版本、渠道、拓扑和工作负载信息;信息不足时会使用并标记假设。
  • 完整的运行手册、检查清单和故障诊断命令依赖未随提示提供的 references 文件。
  • 源材料没有测试套件、执行结果或平台兼容性验证记录。
  • 实际升级仍依赖 GKE、gcloud、kubectl 及目标环境中的容量、配额和权限。

如何安装这个 Skill?

该技能位于仓库的 skills/cloud/gke-upgrades/SKILL.md。安装整个 Google Skills 集合可运行:npx skills add google/skills,随后从仓库中选择需要的技能。源材料未说明单独安装该技能的命令或具体客户端目录布局。

如何使用这个 Skill?

将技能文件安装到兼容 Agent Skills 的客户端后,用自然语言提出具体任务,例如“规划下一次 GKE 集群维护”或“我们的 GKE 升级卡住了”。提供集群模式、当前和目标版本、发布渠道、环境拓扑及工作负载类型,可直接获得更具体的计划或运行手册。源材料未提供固定命令入口或完整的引用模板内容。

这个 Skill 与同类方案有什么区别?

该技能明确将集群创建、应用接入、通用网络配置和安全策略配置排除在外,并建议使用 gke-basics 或相关 GKE 技能处理这些任务。

常见问题

它会自动升级我的 GKE 集群吗?
不会。它生成计划、运行手册、命令和检查清单;源材料没有说明它会直接执行升级。
维护排除项能阻止所有升级吗?
只能阻止自动升级,用户手动发起的升级会绕过排除项。需要允许补丁修复时,应优先考虑“无次版本或节点升级”范围,而不是会阻止补丁的“无升级”范围。
GPU 集群适合使用 Blue-Green 升级吗?
该技能指出固定 GPU 预留场景通常应使用零 Surge 的滚动升级,因为 Blue-Green 需要过渡期间约两倍的 GPU 资源、配额和预留。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

自动化与运维 ✓ Google · 官方

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

自动化与运维 ✓ Google · 官方

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

GKE 集群网络规划与配置

为 GKE 设计私有、VPC 原生且可扩展的集群网络。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

自动化与运维 ✓ Google · 官方

GKE 工作负载安全

审计并强化 GKE 应用与命名空间的工作负载级安全控制。

自动化与运维 ✓ Google · 官方

GKE 应用上云助手

帮助团队首次将应用容器化并部署到 Google Kubernetes Engine。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

自动化与运维 ✓ Google · 官方

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

自动化与运维 ✓ Google · 官方

GKE 存储管理

为 GKE 集群配置持久磁盘、Filestore 与 GCS FUSE 存储。

自动化与运维 ✓ Google · 官方

GKE 批处理与 HPC 工作负载

在 GKE 上配置、调度并运行批处理、并行计算和 HPC 作业。

自动化与运维 ✓ Google · 官方

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

自动化与运维 ✓ Google · 官方

GKE 平台安全加固

帮助平台团队规划并实施 GKE 集群级安全加固。

自动化与运维 ✓ Google · 官方

GKE 备份与灾难恢复

为有状态 GKE 工作负载配置备份策略与恢复流程。

相关 Skills