自动化与运维 ✓ Google · 官方 gkekubernetes-jobshpcmpikueuejobsetspot-vms

GKE 批处理与 HPC 工作负载

在 GKE 上配置、调度并运行批处理、并行计算和 HPC 作业。

FollowSkills 评估 · FSRS-2.0
不推荐
42/ 100 五分制 2.1 / 5
信任安全11 / 25 · 2.2/5

技能明确列出可用的 Kubernetes 操作工具,并给出资源请求、限额、配额和检查点等安全相关建议;但包含删除资源、安装远程 latest 发布物和在线 raw YAML 的高影响操作,没有用户确认、最小权限、敏感数据流、依赖校验或回滚方案,因此扣分。

可靠稳定7 / 20 · 1.8/5

批处理、JobSet、Kueue、MPI 和扩缩容示例在结构上较连贯,且提供部分重试与检查点建议;但未提供测试、版本兼容矩阵、异常输入处理或可诊断的失败反馈,远程依赖和 CRD 可用性也未验证,因此静态评估限制在中低分。

适用触发8 / 15 · 2.7/5

目标场景、主要适用工作负载以及“不适用于标准 Web 应用”的边界描述较清楚;但输入要求、期望输出、触发条件和非适用范围仍不完整,也没有中文支持或中国大陆网络可达性说明,因此扣分。

规范维护7 / 15 · 2.3/5

文档按批处理、HPC、成本和生产建议分层,包含安装片段和示例;但缺少技能级版本、变更记录、维护责任、依赖版本、故障排查、FAQ 和限制说明,README 的许可证与支持信息只能提供仓库级治理证据,因此扣分。

有效结果6 / 15 · 2.0/5

提供了可直接改写的 Job、JobSet、Kueue、MPI 和节点池片段,对熟悉 GKE 的用户有实际参考价值;但镜像、集群和区域均为占位符,未覆盖完整部署、验证、权限、网络和清理流程,且没有可验证的代表性结果,因此仅给有限分数。

证据核验3 / 10 · 1.5/5

源文件包含可审计的命令、YAML 和配置建议,README、许可证及发布者信息提供了有限可追溯性;但没有测试套件、CI 执行证据、结果样例或独立交叉验证,结论主要依赖静态阅读,因此分数较低。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 安装命令使用远程 latest 或未固定版本的 YAML,执行前应审查来源、版本、权限和变更内容。
  • 技能列出的 delete_k8s_resource 可能产生不可逆影响;应在用户明确确认、目标范围明确且已有备份或恢复方案后使用。
  • 示例依赖 Kueue、JobSet 和 MPI Operator 等 CRD,未说明安装顺序、兼容版本、命名空间、IAM 或网络要求。
  • Spot、维护排除和自动扩缩容可能影响成本、可用性及升级安全;生产使用前应验证检查点和恢复策略。
  • 未提供中文说明或中国大陆网络可达性证据。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向需要在 Google Kubernetes Engine 上运行批处理或高性能计算工作负载的用户。它涵盖 Kubernetes Job、JobSet、Kueue、紧凑型节点放置和 MPIJob。内容还涉及 Spot VM、节点池缩容至零、资源配额、维护排除和检查点等生产实践。它不适用于标准 Web 应用部署,后者应使用 gke-app-onboarding。

通过 Kubernetes 清单和命令配置 Job、JobSet、ClusterQueue、LocalQueue、MPIJob 及 GKE HPC 节点池;使用 kubectl 安装 Kueue 和 MPI Operator;使用 gcloud 创建启用紧凑型放置和自动扩缩的节点池;引用 apply_k8s_manifest、get_k8s_resource、describe_k8s_resource、get_k8s_logs、delete_k8s_resource 和 list_k8s_events 处理 Kubernetes 资源与日志。

  1. 数据工程师在 GKE 上运行可并行的数据处理流水线。
  2. 科研或工程团队在 GKE 上运行 CFD、分子动力学或金融建模模拟。
  3. 机器学习团队在 GKE 上提交多节点训练作业。
  4. 平台团队使用 Kueue 为多租户批处理作业分配 CPU 和内存配额。
  5. 工程团队使用 MPI Operator 编排分布式 MPI 应用。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从 Kubernetes Job 到 JobSet、Kueue 和 MPIJob 的批处理/HPC 常见模式。
  • 提供可复制的 YAML、kubectl 和 gcloud 示例。
  • 包含 Spot VM、缩容至零、资源配额和检查点等成本与韧性建议。
局限
  • 示例使用占位符,如 `<IMAGE>`、`<CLUSTER_NAME>` 和 `<REGION>`,不能直接用于生产环境。
  • 来源没有提供测试套件、版本兼容矩阵或完整故障排查流程。
  • 部分安装命令从外部 GitHub URL 获取清单,实际执行依赖网络和集群权限。

如何安装这个 Skill?

该技能属于 google/skills 集合。运行 npx skills add google/skills,并在安装过程中选择 skills/cloud/gke-batch-hpc。来源未说明单独安装或额外本地文件的步骤。

如何使用这个 Skill?

在已安装该技能的 Agent Skills 客户端中提出具体任务,例如:在 GKE 上配置一个使用 Kueue 排队、并行度为 10 的批处理 Job,或为 GKE HPC 集群配置紧凑型放置并运行 MPIJob。执行相关操作还需要可用的 Kubernetes/GKE 环境及文中列出的工具。

这个 Skill 与同类方案有什么区别?

对于标准 Web 应用部署,SKILL.md 明确建议使用同仓库的 gke-app-onboarding,而不是本技能。

常见问题

运行该技能是否会产生 Google Cloud 费用?
来源未提供费用信息;实际费用取决于所创建的 GKE 集群、节点池、Spot VM 或其他资源。
需要哪些权限?
来源显示需要执行 gcloud、kubectl 和 Kubernetes 资源操作,因此需要相应的 GKE、节点池及 Kubernetes 资源权限;具体 IAM 角色未说明。
Spot VM 被中断时如何恢复?
技能建议设置 Job 的 `backoffLimit`,并实施应用级检查点;长时间训练还应考虑 GKE maintenance exclusions。
它能否用于普通 Web 服务部署?
不能作为推荐范围;来源明确建议普通 Web 应用使用 `gke-app-onboarding`。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

自动化与运维 ✓ Google · 官方

GKE 成本优化助手

通过资源调优、Spot 虚拟机和配额控制降低 GKE 成本。

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

自动化与运维 ✓ Google · 官方

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

自动化与运维 ✓ Google · 官方

GKE 工作负载安全

审计并强化 GKE 应用与命名空间的工作负载级安全控制。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

自动化与运维 ✓ Google · 官方

GKE 应用上云助手

帮助团队首次将应用容器化并部署到 Google Kubernetes Engine。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

自动化与运维 ✓ Google · 官方

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

自动化与运维 ✓ Google · 官方

GKE 存储管理

为 GKE 集群配置持久磁盘、Filestore 与 GCS FUSE 存储。

自动化与运维 ✓ Google · 官方

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

自动化与运维 ✓ Google · 官方

GKE 平台安全加固

帮助平台团队规划并实施 GKE 集群级安全加固。

自动化与运维 ✓ Google · 官方

GKE 备份与灾难恢复

为有状态 GKE 工作负载配置备份策略与恢复流程。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

自动化与运维 ✓ Google · 官方

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

相关 Skills