自动化与运维 ✓ Google · 官方 gkegputpunode-disruptioncloud-monitoringpromqlpoddisruptionbudget

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

FollowSkills 评估 · FSRS-2.0
不推荐
50/ 100 五分制 2.5 / 5
信任安全16 / 25 · 3.2/5

流程主要建议读取节点标签、PromQL、日志和污点,且未包含破坏性默认操作;但未明确要求执行命令前获得用户确认,未说明日志或遥测中的敏感数据处理、权限范围、数据流、回滚方案或完整来源归因,因此扣分。

可靠稳定7 / 20 · 1.8/5

步骤顺序和输入要求较清晰,包含负面结果分支与部分解释;但未提供脚本、测试、CI 或异常输入处理,且“存在计划维护标签即保证发生中断”等表述可能过度绝对化,静态证据不足,因此扣分。

适用触发9 / 15 · 3.0/5

名称、适用场景、可选参数和排除场景均有说明,覆盖 GPU/TPU 节点维护中断诊断;但未定义更多边界、输出格式或触发细则,也未提供中文支持,并依赖 GKE、kubectl、Cloud Monitoring/Logging 等环境,故扣分。

规范维护8 / 15 · 2.7/5

文档按诊断步骤组织,包含安装仓库说明、Apache-2.0 许可和若干命令示例;但技能文件没有版本、变更记录、依赖安装、维护责任或专门更新路径,限制条件和 FAQ 也不充分,因此扣分。

有效结果6 / 15 · 2.0/5

该流程可直接指导维护标签、PromQL、日志和污点检查,并给出终止宽限期、机会式维护和 PDB 等缓解方向;但没有可验证的代表性输出,强制三项缓解措施可能不适用于所有工作负载,且静态审查无法证明结果正确性,因此扣分。

证据核验4 / 10 · 2.0/5

技能包含具体字段、指标、PromQL 和 Google Cloud 文档链接,具备有限的审计线索;但没有提交测试、CI 覆盖、执行记录或多来源交叉验证,结论主要依赖作者说明,因此扣分。

证据充分度: 评估于 2026年7月28日 审查版本 d1c9be2009ba
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • “存在计划维护标签即保证发生中断”等结论应结合官方语义和实际事件证据复核。
  • 执行 kubectl、日志查询或监控查询前,应确认用户授权、最小权限和敏感数据脱敏要求。
  • 机会式维护、终止宽限期和 PDB 三项措施应按工作负载类型、控制器行为及恢复目标逐项适配,不宜无条件强制。
  • 该技能未提供中文说明或中国大陆网络可达性信息,相关 Google Cloud 服务访问可能受环境影响。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向运行 GPU 或 TPU 工作负载的 GKE 节点池。它通过节点维护标签、Cloud Monitoring PromQL、Cloud Logging 和节点污点,判断中断是否由 Compute Engine 主机维护引起。确认维护事件后,它会建议优雅终止、机会性维护和 PodDisruptionBudget 三项保护措施。若所有维护信号均为空,则引导用户排查 OOMKill、CUDA 错误或资源限制等应用层原因。

在实际故障信息不完整时,先要求 project_id、location、cluster_name 和 timestamp;使用 kubectl 查询 scheduled-maintenance-time 标签;提供 kubernetes_io:node_interruption_count 和 node_pool_interruption_count 的 PromQL;检查 active-node-maintenance=ONGOING 日志及 impending-node-termination:NoSchedule 污点;输出高信号结论并建议配置 terminationGracePeriodSeconds、机会性维护和 PodDisruptionBudget。

  1. GKE 运维人员调查 GPU 节点意外重启或工作负载中断。
  2. 平台工程师检查 GPU/TPU 节点池是否即将进行主机维护。
  3. 可观测性工程师用 PromQL 跟踪硬件或软件维护导致的节点中断。
  4. 机器学习团队为需要保存检查点的工作负载配置中断保护。
  5. 团队需要区分 Compute Engine 主机维护与 OOMKill、CUDA 错误等应用层故障。

这个 Skill 有哪些优点和局限?

优点
  • 针对 GKE GPU/TPU 节点主机维护中断,范围清晰。
  • 提供具体的 kubectl 查询、PromQL 指标和日志/污点检查方法。
  • 明确规定维护事件确认后的三项工作负载保护措施。
  • 对维护信号为空的情况提供应用层故障排查方向。
局限
  • 只覆盖主机维护导致的节点中断,不适用于一般 GKE 集群创建、网络策略或非中断部署。
  • 实际调查要求四项完整集群上下文,不能在信息不足时直接给出诊断理论。
  • 源材料未提供测试套件、版本兼容矩阵或具体权限说明。
  • 源材料未说明如何配置安装目录或自动调用 Cloud Monitoring/Logging 工具。

如何安装这个 Skill?

使用仓库 README 提供的命令安装技能集合:npx skills add google/skills。安装过程中可选择此仓库中的具体技能;README 未说明具体安装目录或单独选择该技能的命令。

如何使用这个 Skill?

将此技能目录中的 SKILL.md 放入 Agent Skills 客户端可发现的技能目录,然后请求类似“调查项目 PROJECT_ID、区域 LOCATION、集群 CLUSTER_NAME 在 TIMESTAMP 发生的 GPU 节点中断”。实际故障调查必须提供 project_id、location、cluster_name 和 timestamp;缺少这些信息时,应先补齐上下文。

常见问题

这个技能是否需要付费?
源材料没有提供该技能的定价信息。
没有 project_id、location、cluster_name 或 timestamp 能否开始调查?
按照技能规则,实际故障调查必须先补齐这四项参数;只有请求通用 runbook 或提供完整静态遥测/日志转储时可以跳过。
如果维护标签、PromQL 和日志都没有结果怎么办?
应确定主机维护不是原因,并转而检查 OOMKill、CUDA runtime 错误或资源限制等应用层问题。
是否应该容忍 impending-node-termination:NoSchedule 污点?
不应该。该污点表示 GKE 已封锁节点以防止新 Pod 调度。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

自动化与运维 ✓ Google · 官方

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

自动化与运维 ✓ Google · 官方

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

自动化与运维 ✓ Google · 官方

GKE 成本优化助手

通过资源调优、Spot 虚拟机和配额控制降低 GKE 成本。

自动化与运维 ✓ Google · 官方

GKE 服务网络配置

为 GKE 应用配置安全的边缘流量、负载均衡与私有服务连接。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

开发与工程 ✓ Google · 官方

Google Agents CLI 智能体开发引导

引导智能体从设计、开发到部署与监控的完整流程。

自动化与运维 ✓ Google · 官方

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

自动化与运维 ✓ Google · 官方

Google Cloud 监控指标选择器

为 GCP 服务发现并筛选相关监控指标。

自动化与运维 ✓ Google · 官方

Google Cloud 基础落地区构建器

为 Google Cloud 组织部署安全的企业级基础落地区。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

GKE 集群成本分析

用 BigQuery 账单数据和集群指标定位 GKE 集群、命名空间与工作负载的成本来源。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

自动化与运维 ✓ Google · 官方

GKE 工作负载安全

审计并强化 GKE 应用与命名空间的工作负载级安全控制。

相关 Skills