GKE 集群创建顾问
按生产最佳实践规划、创建并审计 GKE 集群。
技能要求收集项目、区域和集群名称,并在创建前展示配置并请求确认;默认建议私有节点、授权网络、Secret Manager 和 Workload Identity,体现一定的最小权限与安全意识。扣分原因是创建操作具有外部基础设施和费用影响,但没有回滚、删除恢复、失败后的资源清理或完整数据流说明;部分示例使用 cloud-platform OAuth scope,权限偏宽;授权网络示例也未给出具体受限 CIDR。
工作流覆盖发现、输入收集、创建、操作跟踪和验证,且列出 MCP 工具。扣分原因是仅有静态文档,缺少测试和可复现证据;多个示例与最佳实践不完全一致,例如部分模板未配置私有集群、Workload Identity、Shielded Nodes 或完整网络参数;没有系统化的错误处理、配额失败、权限失败和部分创建状态反馈。表格还存在明显格式损坏。
描述明确覆盖 GKE 集群创建、模式选择、GPU/AI 场景和生产就绪审计,并明确排除应用 onboarding;要求缺失关键参数时询问用户。扣分原因是非适用边界、所需权限、现有网络约束和审计输入输出未充分定义;没有中文支持说明,也未说明中国大陆网络对 gcloud、MCP 或相关 Google Cloud 服务可达性的适配。
技能具有 front matter、分层工作流、模式表、最佳实践、模板和安装仓库上下文;仓库提供 Apache-2.0、GitHub 维护入口和 active development 说明。扣分原因是技能自身没有版本、变更记录、维护责任人或更新路径;引用的相邻文档和工具契约未随本技能给出;故障排查、参数约束、FAQ 和模板差异说明不足,且模式表格式异常。
提供 Autopilot、Standard、GPU 和 Hypercompute 的 gcloud/MCP 配置骨架,并要求创建前确认、创建后读取验证,能够覆盖核心规划任务。扣分原因是静态材料无法证明命令和 JSON 在当前 API 版本中可直接运行;关键配置不一致或不完整,部分模板可能需要用户自行补充网络、身份和权限设置;没有展示已验证的代表性输出或审计报告格式。
材料包含具体命令、MCP payload、配置字段和相邻文件引用,具备一定审计线索;仓库来源、许可证和修订信息由评审上下文提供。扣分原因是没有提交测试套件、CI 覆盖、第三方执行记录或交叉来源;文档中的最佳实践和命令均未在本次静态审查中执行验证,因此结论主要依赖作者提供的单一材料。
- 创建 GKE 集群会产生云资源和费用;必须在确认前核对项目、区域、配额、网络 CIDR、权限和预期成本。
- 不要将 cloud-platform OAuth scope 或未限制的授权网络示例直接用于生产;应根据实际工作负载收紧权限和入口。
- 文档中的 gcloud 与 MCP 示例并非始终包含同等安全配置,执行前需要逐项比对并验证当前 API 参数。
- 本次结论仅为静态审查,未执行命令、MCP 调用或集群验证。
这个 Skill 能做什么,适合哪些场景?
该技能用于规划和执行 Google Kubernetes Engine 集群的创建、配置与生产就绪审计。它默认推荐生产级 Autopilot 黄金路径,也支持 Standard Regional、GPU 推理和 AI Hypercompute 模板。流程涵盖环境发现、模式选择、网络配置、配置确认、集群创建、操作跟踪和结果验证。它不负责应用接入或部署配置。
读取现有集群和当前项目上下文,收集 project_id、区域或位置、集群名称及环境类型;比较 Autopilot 与 Standard 等模式并说明取舍;生成 gcloud 命令或 create_cluster JSON 配置;在获得确认后调用 create_cluster 或使用 gcloud 创建集群;通过 get_operation 跟踪进度,并使用 get_cluster 和 readMask="*" 验证配置。可调用 list_clusters、create_cluster、get_cluster、list_operations 和 get_operation 等 MCP 工具。
- 需要创建生产 GKE 集群、但尚未确定 Autopilot 或 Standard 模式的云平台工程师。
- 希望采用私有节点、VPC 原生网络、Workload Identity 和发布渠道的生产环境团队。
- 需要为 AI 推理配置 L4 GPU、并确认配额要求的机器学习平台团队。
- 因内核调优、节点操作系统或特权工作负载而不能使用 Autopilot 的基础设施团队。
- 需要检查现有 GKE 集群是否符合预期黄金路径设置的运维人员。
这个 Skill 有哪些优点和局限?
- 提供 Autopilot、Standard Regional、GPU 推理和 AI Hypercompute 等明确模板。
- 内置私有集群、VPC 原生网络、Workload Identity、Shielded Nodes、自动扩缩容和区域高可用等建议。
- 在创建前要求展示配置并取得用户确认。
- 能够通过 MCP 工具或 gcloud CLI 执行创建和后续验证。
- 依赖 GKE、gcloud CLI、kubectl 或相应 MCP 工具;源材料未提供测试套件或平台验证记录。
- GPU 和 AI Hypercompute 模板需要特定配额,且成本较高。
- Standard 模式需要手动管理节点池、升级和自动扩缩容,运维负担更高。
- 部分网络和私有节点决策属于难以事后更改的 Day-0 选择。
如何安装这个 Skill?
运行 npx skills add google/skills,然后从交互式选择中安装 GKE Cluster Creation 技能。源材料未说明其他安装方式或固定安装目录。
如何使用这个 Skill?
向支持 Agent Skills 的客户端提出具体请求,例如:“为 project_id 为 my-project、位于 us-central1 的生产环境创建名为 prod-cluster 的 GKE 集群。”技能会要求确认缺失的必要信息,默认提出 Autopilot 配置,展示 gcloud 命令或 JSON payload,并在确认后创建和验证集群。
这个 Skill 与同类方案有什么区别?
技能明确比较 Autopilot 与 Standard:Autopilot 由 Google 管理节点并按 Pod 资源计费,Standard 由用户管理节点并按虚拟机节点计费。它还将 GKE 集群创建与 gke-app-onboarding 区分开,后者用于应用接入或部署配置。