GKE ComputeClasses 配置助手
帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。
技能明确要求使用占位符、标注“EXAMPLE TEMPLATE - DO NOT DEPLOY”、先询问关键环境信息,并拒绝关闭节点安全措施或嵌入服务账号密钥;还覆盖权限治理、注入防护、Spot 驱逐和回滚相关风险。未说明完整的数据流、用户执行确认、变更回滚方案或依赖安全审计,因此扣分。
文档包含较细的 schema 约束、异常场景、调度故障解释和日志脚本错误提示,快乐路径较可信。未提供可执行测试、CI 覆盖或对所引用 reference 文件内容的完整证据,且部分版本和行为声明无法通过静态材料复现,因此按静态上限保守计分。
用途、适用场景和明确非适用范围清晰,涵盖 Spot、GPU/TPU、机器族、区域、权限和故障排查,也提供了 Pod、PV、Autopilot 等边界提示。缺少中文使用说明、输入输出契约和触发/不触发示例;核心 GKE/GCP 服务对中国大陆网络可达性未说明,因此扣分。
SKILL.md 具有分层结构、索引、快速操作、示例资产、限制和安装入口;仓库 README 提供 Apache-2.0、安装方式、维护与 issue 路径,官方组织和 revision 也提供了基本治理线索。缺少技能级版本、变更日志、维护责任人、依赖版本矩阵、FAQ,以及被索引 reference 文件未随本次证据提供,因此扣分。
内容直接面向 ComputeClass 配置、优化和排障,模板覆盖多种代表性场景,日志脚本也提供了可操作的诊断输出。由于没有执行结果、真实用户任务验证或替代方案比较,无法确认模板在目标 GKE 版本和区域中可直接使用,按静态上限不超过 7 分。
文件本身提供了 revision 范围内的 YAML、Shell 实现、版本条件、错误消息和引用路径,具备一定审计性。没有提交测试套件、CI 结果、第三方执行证据或多源交叉验证;外部文档 URL 仅出现在脚本注释中且本评估禁止补充证据,因此只能低分。
- 所有 YAML 都应在目标 GKE 版本、区域、配额、CUD/Reservation 和实际 CRD schema 下先审查并验证;文档明确要求不要直接部署示例模板。
- 日志脚本会读取项目日志并可追加写入用户指定路径;使用前应确认 gcloud/kubectl 身份、最小日志权限、日志内容敏感性以及输出文件权限。
- 技能依赖 GKE、gcloud、kubectl、jq 及若干版本特性;未提供中国大陆网络可达性、版本兼容矩阵或可执行测试证据。
这个 Skill 能做什么,适合哪些场景?
该技能面向需要在 GKE 中管理 ComputeClasses 的工程师,涵盖 Spot VM 回退、GPU/TPU 与机器族选择、区域定位和节点池自动创建。它提供配置建议、YAML 模板规范、调度故障排查和访问治理指导。内容也覆盖 Stateful PV、预留资源、Autopilot 模式、Karpenter 迁移及安全边界。它不用于集群级 Node Auto Provisioning 配置或通用 GKE 集群创建。
指导代理根据成本、加速器、机器族、区域、CUD/Reservations 和工作负载约束设计 ComputeClass;生成带有明确限制和占位符的 YAML 示例;解释优先级、Spot、预留资源、节点池自动创建、GPU/Spot 污点、PV 拓扑和 Pod 调度规则;指导使用 kubectl 检查 ComputeClass CRD,并引用仓库中的参考文档、日志脚本和 YAML 资产进行排查与治理。
- GKE 平台工程师希望为可横向扩展的无状态工作负载配置 Spot VM,并在容量不足时回退到按需实例。
- 机器学习团队需要让 GPU 或 TPU 工作负载选择 L4、H100 或 v5p 等特定加速器。
- 基础设施团队需要根据 CUD、Reservations、机器族和可用区设计可靠的优先级回退链。
- 运维团队遇到 GPU Pod、Spot Pod 或受区域 PV 约束的 Pod Pending/noScaleUp,需要定位污点、选择器或存储拓扑问题。
- 平台管理员需要分别限制谁能修改 ComputeClass,以及哪些命名空间或工作负载可以使用它。
这个 Skill 有哪些优点和局限?
- 覆盖 ComputeClass 配置、成本优化、调度故障排查和访问治理等完整场景。
- 明确处理 GPU/Spot 污点、PV 磁盘代际、预留资源回退和大规格机器容量不足等常见陷阱。
- 包含参考文档、YAML 资产和日志脚本入口。
- 强调 CUD/Reservations、Pod requests 和区域约束,适合需要可靠回退策略的 GKE 环境。
- 建议依赖具体 GKE 版本、区域、可用资源和现有预留配置,通用模板不能直接视为生产配置。
- 内容主要是指导和示例;源材料未提供测试套件或实际集群验证结果。
- 需要用户自行提供环境上下文,并使用 kubectl 或仓库资产完成验证和排查。
如何安装这个 Skill?
运行 npx skills add google/skills,然后在安装选择中选择 GKE ComputeClasses。README 未说明具体安装目录或单独安装该技能的命令。
如何使用这个 Skill?
安装后,可用类似以下请求触发:Help me configure a GKE ComputeClass for GPU workloads with on-demand fallback and troubleshoot pending pods. 提供已有 CUD/Reservations、工作负载是否有状态、集群节点池、区域/可用区及 Pod requests,可获得更具体的建议。不要将其用于集群级 Node Auto Provisioning 配置或一般 GKE 集群创建。