自动化与运维 ✓ Google · 官方 gkekubernetescompute-classesnode-autoscalinggpu-workloadsspot-vmsworkload-governance

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

FollowSkills 评估 · FSRS-2.0
不推荐
57/ 100 五分制 2.9 / 5
信任安全18 / 25 · 3.6/5

技能明确要求使用占位符、标注“EXAMPLE TEMPLATE - DO NOT DEPLOY”、先询问关键环境信息,并拒绝关闭节点安全措施或嵌入服务账号密钥;还覆盖权限治理、注入防护、Spot 驱逐和回滚相关风险。未说明完整的数据流、用户执行确认、变更回滚方案或依赖安全审计,因此扣分。

可靠稳定8 / 20 · 2.0/5

文档包含较细的 schema 约束、异常场景、调度故障解释和日志脚本错误提示,快乐路径较可信。未提供可执行测试、CI 覆盖或对所引用 reference 文件内容的完整证据,且部分版本和行为声明无法通过静态材料复现,因此按静态上限保守计分。

适用触发11 / 15 · 3.7/5

用途、适用场景和明确非适用范围清晰,涵盖 Spot、GPU/TPU、机器族、区域、权限和故障排查,也提供了 Pod、PV、Autopilot 等边界提示。缺少中文使用说明、输入输出契约和触发/不触发示例;核心 GKE/GCP 服务对中国大陆网络可达性未说明,因此扣分。

规范维护9 / 15 · 3.0/5

SKILL.md 具有分层结构、索引、快速操作、示例资产、限制和安装入口;仓库 README 提供 Apache-2.0、安装方式、维护与 issue 路径,官方组织和 revision 也提供了基本治理线索。缺少技能级版本、变更日志、维护责任人、依赖版本矩阵、FAQ,以及被索引 reference 文件未随本次证据提供,因此扣分。

有效结果7 / 15 · 2.3/5

内容直接面向 ComputeClass 配置、优化和排障,模板覆盖多种代表性场景,日志脚本也提供了可操作的诊断输出。由于没有执行结果、真实用户任务验证或替代方案比较,无法确认模板在目标 GKE 版本和区域中可直接使用,按静态上限不超过 7 分。

证据核验4 / 10 · 2.0/5

文件本身提供了 revision 范围内的 YAML、Shell 实现、版本条件、错误消息和引用路径,具备一定审计性。没有提交测试套件、CI 结果、第三方执行证据或多源交叉验证;外部文档 URL 仅出现在脚本注释中且本评估禁止补充证据,因此只能低分。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 所有 YAML 都应在目标 GKE 版本、区域、配额、CUD/Reservation 和实际 CRD schema 下先审查并验证;文档明确要求不要直接部署示例模板。
  • 日志脚本会读取项目日志并可追加写入用户指定路径;使用前应确认 gcloud/kubectl 身份、最小日志权限、日志内容敏感性以及输出文件权限。
  • 技能依赖 GKE、gcloud、kubectl、jq 及若干版本特性;未提供中国大陆网络可达性、版本兼容矩阵或可执行测试证据。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向需要在 GKE 中管理 ComputeClasses 的工程师,涵盖 Spot VM 回退、GPU/TPU 与机器族选择、区域定位和节点池自动创建。它提供配置建议、YAML 模板规范、调度故障排查和访问治理指导。内容也覆盖 Stateful PV、预留资源、Autopilot 模式、Karpenter 迁移及安全边界。它不用于集群级 Node Auto Provisioning 配置或通用 GKE 集群创建。

指导代理根据成本、加速器、机器族、区域、CUD/Reservations 和工作负载约束设计 ComputeClass;生成带有明确限制和占位符的 YAML 示例;解释优先级、Spot、预留资源、节点池自动创建、GPU/Spot 污点、PV 拓扑和 Pod 调度规则;指导使用 kubectl 检查 ComputeClass CRD,并引用仓库中的参考文档、日志脚本和 YAML 资产进行排查与治理。

  1. GKE 平台工程师希望为可横向扩展的无状态工作负载配置 Spot VM,并在容量不足时回退到按需实例。
  2. 机器学习团队需要让 GPU 或 TPU 工作负载选择 L4、H100 或 v5p 等特定加速器。
  3. 基础设施团队需要根据 CUD、Reservations、机器族和可用区设计可靠的优先级回退链。
  4. 运维团队遇到 GPU Pod、Spot Pod 或受区域 PV 约束的 Pod Pending/noScaleUp,需要定位污点、选择器或存储拓扑问题。
  5. 平台管理员需要分别限制谁能修改 ComputeClass,以及哪些命名空间或工作负载可以使用它。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 ComputeClass 配置、成本优化、调度故障排查和访问治理等完整场景。
  • 明确处理 GPU/Spot 污点、PV 磁盘代际、预留资源回退和大规格机器容量不足等常见陷阱。
  • 包含参考文档、YAML 资产和日志脚本入口。
  • 强调 CUD/Reservations、Pod requests 和区域约束,适合需要可靠回退策略的 GKE 环境。
局限
  • 建议依赖具体 GKE 版本、区域、可用资源和现有预留配置,通用模板不能直接视为生产配置。
  • 内容主要是指导和示例;源材料未提供测试套件或实际集群验证结果。
  • 需要用户自行提供环境上下文,并使用 kubectl 或仓库资产完成验证和排查。

如何安装这个 Skill?

运行 npx skills add google/skills,然后在安装选择中选择 GKE ComputeClasses。README 未说明具体安装目录或单独安装该技能的命令。

如何使用这个 Skill?

安装后,可用类似以下请求触发:Help me configure a GKE ComputeClass for GPU workloads with on-demand fallback and troubleshoot pending pods. 提供已有 CUD/Reservations、工作负载是否有状态、集群节点池、区域/可用区及 Pod requests,可获得更具体的建议。不要将其用于集群级 Node Auto Provisioning 配置或一般 GKE 集群创建。

常见问题

它能创建 GKE 集群或配置集群级 Node Auto Provisioning 吗?
不能。它专注于 GKE ComputeClasses;源材料明确排除了集群创建和集群级 Node Auto Provisioning 配置。
使用它是否一定能降低成本?
不能保证。它可以指导 Spot、On-Demand、DWS、Reservations 和 CUD 相关策略,但最终成本取决于容量、工作负载约束和现有承诺资源。
为什么 Pod 使用 GPU 或 Spot ComputeClass 后仍然 Pending?
常见原因是缺少对应的 GPU 或 Spot 污点容忍度,也可能是硬节点选择器冲突、区域资源不足或 Pod requests 与节点规格不匹配。
谁适合采用这个技能?
适合管理 GKE 计算资源、自动扩缩容、GPU/TPU 工作负载、成本策略或 ComputeClass 访问治理的平台与运维团队。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

自动化与运维 ✓ Google · 官方

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

自动化与运维 ✓ Google · 官方

GKE 成本优化助手

通过资源调优、Spot 虚拟机和配额控制降低 GKE 成本。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

自动化与运维 ✓ Google · 官方

GKE 批处理与 HPC 工作负载

在 GKE 上配置、调度并运行批处理、并行计算和 HPC 作业。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 应用上云助手

帮助团队首次将应用容器化并部署到 Google Kubernetes Engine。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

自动化与运维 ✓ Google · 官方

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

自动化与运维 ✓ Google · 官方

GKE 存储管理

为 GKE 集群配置持久磁盘、Filestore 与 GCS FUSE 存储。

自动化与运维 ✓ Google · 官方

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

自动化与运维 ✓ Google · 官方

GKE 备份与灾难恢复

为有状态 GKE 工作负载配置备份策略与恢复流程。

自动化与运维 ✓ Google · 官方

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

自动化与运维 ✓ Google · 官方

GKE 工作负载安全

审计并强化 GKE 应用与命名空间的工作负载级安全控制。

自动化与运维 ✓ Google · 官方

GKE 平台安全加固

帮助平台团队规划并实施 GKE 集群级安全加固。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

相关 Skills