GKE 批处理与 HPC 工作负载
在 GKE 上配置、调度并运行批处理、并行计算和 HPC 作业。
技能明确列出可用的 Kubernetes 操作工具,并给出资源请求、限额、配额和检查点等安全相关建议;但包含删除资源、安装远程 latest 发布物和在线 raw YAML 的高影响操作,没有用户确认、最小权限、敏感数据流、依赖校验或回滚方案,因此扣分。
批处理、JobSet、Kueue、MPI 和扩缩容示例在结构上较连贯,且提供部分重试与检查点建议;但未提供测试、版本兼容矩阵、异常输入处理或可诊断的失败反馈,远程依赖和 CRD 可用性也未验证,因此静态评估限制在中低分。
目标场景、主要适用工作负载以及“不适用于标准 Web 应用”的边界描述较清楚;但输入要求、期望输出、触发条件和非适用范围仍不完整,也没有中文支持或中国大陆网络可达性说明,因此扣分。
文档按批处理、HPC、成本和生产建议分层,包含安装片段和示例;但缺少技能级版本、变更记录、维护责任、依赖版本、故障排查、FAQ 和限制说明,README 的许可证与支持信息只能提供仓库级治理证据,因此扣分。
提供了可直接改写的 Job、JobSet、Kueue、MPI 和节点池片段,对熟悉 GKE 的用户有实际参考价值;但镜像、集群和区域均为占位符,未覆盖完整部署、验证、权限、网络和清理流程,且没有可验证的代表性结果,因此仅给有限分数。
源文件包含可审计的命令、YAML 和配置建议,README、许可证及发布者信息提供了有限可追溯性;但没有测试套件、CI 执行证据、结果样例或独立交叉验证,结论主要依赖静态阅读,因此分数较低。
- 安装命令使用远程 latest 或未固定版本的 YAML,执行前应审查来源、版本、权限和变更内容。
- 技能列出的 delete_k8s_resource 可能产生不可逆影响;应在用户明确确认、目标范围明确且已有备份或恢复方案后使用。
- 示例依赖 Kueue、JobSet 和 MPI Operator 等 CRD,未说明安装顺序、兼容版本、命名空间、IAM 或网络要求。
- Spot、维护排除和自动扩缩容可能影响成本、可用性及升级安全;生产使用前应验证检查点和恢复策略。
- 未提供中文说明或中国大陆网络可达性证据。
这个 Skill 能做什么,适合哪些场景?
该技能面向需要在 Google Kubernetes Engine 上运行批处理或高性能计算工作负载的用户。它涵盖 Kubernetes Job、JobSet、Kueue、紧凑型节点放置和 MPIJob。内容还涉及 Spot VM、节点池缩容至零、资源配额、维护排除和检查点等生产实践。它不适用于标准 Web 应用部署,后者应使用 gke-app-onboarding。
通过 Kubernetes 清单和命令配置 Job、JobSet、ClusterQueue、LocalQueue、MPIJob 及 GKE HPC 节点池;使用 kubectl 安装 Kueue 和 MPI Operator;使用 gcloud 创建启用紧凑型放置和自动扩缩的节点池;引用 apply_k8s_manifest、get_k8s_resource、describe_k8s_resource、get_k8s_logs、delete_k8s_resource 和 list_k8s_events 处理 Kubernetes 资源与日志。
- 数据工程师在 GKE 上运行可并行的数据处理流水线。
- 科研或工程团队在 GKE 上运行 CFD、分子动力学或金融建模模拟。
- 机器学习团队在 GKE 上提交多节点训练作业。
- 平台团队使用 Kueue 为多租户批处理作业分配 CPU 和内存配额。
- 工程团队使用 MPI Operator 编排分布式 MPI 应用。
这个 Skill 有哪些优点和局限?
- 覆盖从 Kubernetes Job 到 JobSet、Kueue 和 MPIJob 的批处理/HPC 常见模式。
- 提供可复制的 YAML、kubectl 和 gcloud 示例。
- 包含 Spot VM、缩容至零、资源配额和检查点等成本与韧性建议。
- 示例使用占位符,如 `<IMAGE>`、`<CLUSTER_NAME>` 和 `<REGION>`,不能直接用于生产环境。
- 来源没有提供测试套件、版本兼容矩阵或完整故障排查流程。
- 部分安装命令从外部 GitHub URL 获取清单,实际执行依赖网络和集群权限。
如何安装这个 Skill?
该技能属于 google/skills 集合。运行 npx skills add google/skills,并在安装过程中选择 skills/cloud/gke-batch-hpc。来源未说明单独安装或额外本地文件的步骤。
如何使用这个 Skill?
在已安装该技能的 Agent Skills 客户端中提出具体任务,例如:在 GKE 上配置一个使用 Kueue 排队、并行度为 10 的批处理 Job,或为 GKE HPC 集群配置紧凑型放置并运行 MPIJob。执行相关操作还需要可用的 Kubernetes/GKE 环境及文中列出的工具。
这个 Skill 与同类方案有什么区别?
对于标准 Web 应用部署,SKILL.md 明确建议使用同仓库的 gke-app-onboarding,而不是本技能。