自动化与运维 ✓ Google · 官方 gkekubernetescluster-provisioningautopilotgoogle-cloudgpu-inference

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全15 / 25 · 3.0/5

技能要求收集项目、区域和集群名称,并在创建前展示配置并请求确认;默认建议私有节点、授权网络、Secret Manager 和 Workload Identity,体现一定的最小权限与安全意识。扣分原因是创建操作具有外部基础设施和费用影响,但没有回滚、删除恢复、失败后的资源清理或完整数据流说明;部分示例使用 cloud-platform OAuth scope,权限偏宽;授权网络示例也未给出具体受限 CIDR。

可靠稳定6 / 20 · 1.5/5

工作流覆盖发现、输入收集、创建、操作跟踪和验证,且列出 MCP 工具。扣分原因是仅有静态文档,缺少测试和可复现证据;多个示例与最佳实践不完全一致,例如部分模板未配置私有集群、Workload Identity、Shielded Nodes 或完整网络参数;没有系统化的错误处理、配额失败、权限失败和部分创建状态反馈。表格还存在明显格式损坏。

适用触发10 / 15 · 3.3/5

描述明确覆盖 GKE 集群创建、模式选择、GPU/AI 场景和生产就绪审计,并明确排除应用 onboarding;要求缺失关键参数时询问用户。扣分原因是非适用边界、所需权限、现有网络约束和审计输入输出未充分定义;没有中文支持说明,也未说明中国大陆网络对 gcloud、MCP 或相关 Google Cloud 服务可达性的适配。

规范维护8 / 15 · 2.7/5

技能具有 front matter、分层工作流、模式表、最佳实践、模板和安装仓库上下文;仓库提供 Apache-2.0、GitHub 维护入口和 active development 说明。扣分原因是技能自身没有版本、变更记录、维护责任人或更新路径;引用的相邻文档和工具契约未随本技能给出;故障排查、参数约束、FAQ 和模板差异说明不足,且模式表格式异常。

有效结果6 / 15 · 2.0/5

提供 Autopilot、Standard、GPU 和 Hypercompute 的 gcloud/MCP 配置骨架,并要求创建前确认、创建后读取验证,能够覆盖核心规划任务。扣分原因是静态材料无法证明命令和 JSON 在当前 API 版本中可直接运行;关键配置不一致或不完整,部分模板可能需要用户自行补充网络、身份和权限设置;没有展示已验证的代表性输出或审计报告格式。

证据核验3 / 10 · 1.5/5

材料包含具体命令、MCP payload、配置字段和相邻文件引用,具备一定审计线索;仓库来源、许可证和修订信息由评审上下文提供。扣分原因是没有提交测试套件、CI 覆盖、第三方执行记录或交叉来源;文档中的最佳实践和命令均未在本次静态审查中执行验证,因此结论主要依赖作者提供的单一材料。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 创建 GKE 集群会产生云资源和费用;必须在确认前核对项目、区域、配额、网络 CIDR、权限和预期成本。
  • 不要将 cloud-platform OAuth scope 或未限制的授权网络示例直接用于生产;应根据实际工作负载收紧权限和入口。
  • 文档中的 gcloud 与 MCP 示例并非始终包含同等安全配置,执行前需要逐项比对并验证当前 API 参数。
  • 本次结论仅为静态审查,未执行命令、MCP 调用或集群验证。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能用于规划和执行 Google Kubernetes Engine 集群的创建、配置与生产就绪审计。它默认推荐生产级 Autopilot 黄金路径,也支持 Standard Regional、GPU 推理和 AI Hypercompute 模板。流程涵盖环境发现、模式选择、网络配置、配置确认、集群创建、操作跟踪和结果验证。它不负责应用接入或部署配置。

读取现有集群和当前项目上下文,收集 project_id、区域或位置、集群名称及环境类型;比较 Autopilot 与 Standard 等模式并说明取舍;生成 gcloud 命令或 create_cluster JSON 配置;在获得确认后调用 create_cluster 或使用 gcloud 创建集群;通过 get_operation 跟踪进度,并使用 get_cluster 和 readMask="*" 验证配置。可调用 list_clusters、create_cluster、get_cluster、list_operations 和 get_operation 等 MCP 工具。

  1. 需要创建生产 GKE 集群、但尚未确定 Autopilot 或 Standard 模式的云平台工程师。
  2. 希望采用私有节点、VPC 原生网络、Workload Identity 和发布渠道的生产环境团队。
  3. 需要为 AI 推理配置 L4 GPU、并确认配额要求的机器学习平台团队。
  4. 因内核调优、节点操作系统或特权工作负载而不能使用 Autopilot 的基础设施团队。
  5. 需要检查现有 GKE 集群是否符合预期黄金路径设置的运维人员。

这个 Skill 有哪些优点和局限?

优点
  • 提供 Autopilot、Standard Regional、GPU 推理和 AI Hypercompute 等明确模板。
  • 内置私有集群、VPC 原生网络、Workload Identity、Shielded Nodes、自动扩缩容和区域高可用等建议。
  • 在创建前要求展示配置并取得用户确认。
  • 能够通过 MCP 工具或 gcloud CLI 执行创建和后续验证。
局限
  • 依赖 GKE、gcloud CLI、kubectl 或相应 MCP 工具;源材料未提供测试套件或平台验证记录。
  • GPU 和 AI Hypercompute 模板需要特定配额,且成本较高。
  • Standard 模式需要手动管理节点池、升级和自动扩缩容,运维负担更高。
  • 部分网络和私有节点决策属于难以事后更改的 Day-0 选择。

如何安装这个 Skill?

运行 npx skills add google/skills,然后从交互式选择中安装 GKE Cluster Creation 技能。源材料未说明其他安装方式或固定安装目录。

如何使用这个 Skill?

向支持 Agent Skills 的客户端提出具体请求,例如:“为 project_id 为 my-project、位于 us-central1 的生产环境创建名为 prod-cluster 的 GKE 集群。”技能会要求确认缺失的必要信息,默认提出 Autopilot 配置,展示 gcloud 命令或 JSON payload,并在确认后创建和验证集群。

这个 Skill 与同类方案有什么区别?

技能明确比较 Autopilot 与 Standard:Autopilot 由 Google 管理节点并按 Pod 资源计费,Standard 由用户管理节点并按虚拟机节点计费。它还将 GKE 集群创建与 gke-app-onboarding 区分开,后者用于应用接入或部署配置。

常见问题

创建集群前必须提供哪些信息?
必须提供 project_id、region 或其他 location,以及唯一的 cluster_name;环境类型等信息也会影响模板选择。
默认应该选择哪种模式?
默认选择生产级 Autopilot,除非存在 Autopilot 无法满足的自定义节点、内核、操作系统或 Hypercompute 要求。
GPU 集群有什么额外注意事项?
L4 GPU 方案需要 g2-standard-4 配额;A3 Hypercompute 需要 a3-highgpu-8g 和 H100 相关配额,并且成本较高。
这个技能会在没有确认时直接创建集群吗?
不会。它要求先展示 gcloud 命令或 create_cluster JSON 配置,并在调用创建工具前取得确认。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

自动化与运维 ✓ Google · 官方

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

自动化与运维 ✓ Google · 官方

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

自动化与运维 ✓ Google · 官方

GKE 成本优化助手

通过资源调优、Spot 虚拟机和配额控制降低 GKE 成本。

自动化与运维 ✓ Google · 官方

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

开发与工程 ✓ Google · 官方

Google Agents CLI 智能体开发引导

引导智能体从设计、开发到部署与监控的完整流程。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

自动化与运维 ✓ Google · 官方

GKE 应用上云助手

帮助团队首次将应用容器化并部署到 Google Kubernetes Engine。

自动化与运维 ✓ Google · 官方

GKE 存储管理

为 GKE 集群配置持久磁盘、Filestore 与 GCS FUSE 存储。

自动化与运维 ✓ Google · 官方

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

自动化与运维 ✓ Google · 官方

GKE 备份与灾难恢复

为有状态 GKE 工作负载配置备份策略与恢复流程。

自动化与运维 ✓ Google · 官方

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

开发与工程 ✓ Google · 官方

Google Cloud Agent Platform 推理助手

帮助开发者连接 Google Cloud Agent Platform 并调用 Gemini 与 OpenMaaS 模型。

自动化与运维 ✓ Google · 官方

Google Cloud 身份认证指南

帮助代理为不同运行环境选择安全的 Google Cloud 认证与授权方案。

相关 Skills