GKE AI 推理部署助手
帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。
文档明确要求认证的 gcloud、GPU/TPU 配额,并提示 Hugging Face token 应放入 Kubernetes Secret;但未说明最小 IAM 权限、数据流、敏感信息处理、部署前用户确认、回滚或删除策略。kubectl apply 可能产生外部基础设施变更,因此扣分;未发现恶意、凭据窃取或隐蔽外传行为。
工作流从模型发现、清单生成到部署和监控基本连贯,命令与参数示例较具体;但未提供版本锁定、命令可用性验证、失败诊断或回滚路径,且表格和故障排查示例存在 Markdown 格式损坏。按静态校准,未执行验证,可靠性保持在 10 分以下。
目标用户、适用场景和“不适用于通用批处理或 HPC 队列”的边界较清楚,也覆盖 GPU、TPU、模型服务器和自动扩缩容;但输入输出契约、触发条件细节、非适用范围和环境兼容性仍不充分,未说明中文使用或中国大陆网络可达性。
具备名称、描述、前置条件、分步工作流、示例、优化和故障排查,仓库还提供 Apache-2.0 许可、安装方式、贡献入口和维护中的说明;但技能本身没有版本、变更记录、维护责任人、更新路径、依赖版本、已知限制或 FAQ,信息分层也较简单。
对常见 GKE 推理部署可提供可直接改写的命令、ComputeClass、HPA 和优化建议,能覆盖核心任务;但没有提交的代表性输出、验证结果或完整生产配置,Secret、PVC、监控指标、模型存储和部署失败处理仍需用户补充,因而只能评为中等偏上且低于静态上限。
技能文件包含可审阅的命令、YAML 和故障表,具备有限的审计线索;但未提供测试套件、CI、第三方执行记录、版本化官方引用或交叉验证。结论主要依赖作者文档,静态证据有限,未执行任何路径。
- 部署示例会修改 GKE/Kubernetes 外部状态,但未要求显式确认、权限审查或提供回滚步骤;生产使用前应先审查生成的 manifest、IAM、Secret、PVC、配额和成本。
- gcloud AI profiles、模型/加速器组合、ComputeClass API、GPU 指标名称及 TPU/GPU 可用性可能随版本和区域变化;文档未锁定版本或给出官方验证链接。
- 部分表格格式损坏,故障排查信息不完整;未证明 Hugging Face、模型仓库或相关 Google 服务在中国大陆网络环境中的可达性。
这个 Skill 能做什么,适合哪些场景?
该技能面向在 Google Kubernetes Engine 上运行 AI/ML 推理工作负载的团队。它使用 Google Inference Quickstart 和 LLM 服务实践,协助选择模型、推理服务器与 GPU/TPU,并生成 Kubernetes 部署清单。它还覆盖 ComputeClass、GPU 指标自动扩缩容及常见推理优化。技能不适用于通用批处理任务或 HPC 任务队列。
它通过 gcloud container ai profiles 列出支持的模型和有效的模型—加速器—服务器组合,并生成 inference.yaml Kubernetes 清单。清单可指定模型、vLLM/TGI/Triton/TensorRT-LLM 等服务器、GPU/TPU 类型以及目标标准化输出 token 延迟。它提供 ComputeClass 示例、基于 GPU 指标的 HorizontalPodAutoscaler 示例和量化、批处理、张量并行、KV 缓存优化建议。部署后可使用 kubectl apply、kubectl get pods 和 kubectl logs,并通过列出的 Kubernetes MCP 工具查看资源、日志、发布状态和事件。
- 需要把 Llama、Gemma 或 Mistral 模型部署到 GKE 的平台工程师。
- 需要为某个模型选择有效 GPU/TPU 与推理服务器组合的 ML 工程师。
- 需要在 GKE Autopilot 中为推理工作负载配置 GPU ComputeClass 的云基础设施团队。
- 需要根据 GPU 利用率或请求队列深度扩展 LLM 服务的运维团队。
- 遇到 GPU 配额不足、模型显存溢出、组合无效或冷启动缓慢的 GKE 使用者。
这个 Skill 有哪些优点和局限?
- 覆盖从模型和硬件发现到清单生成、部署、监控和故障排查的完整推理流程。
- 明确涉及 vLLM、TGI、Triton 和 TensorRT-LLM 等模型服务器。
- 提供 GPU/TPU 选择、ComputeClass、自动扩缩容和显存优化建议。
- 明确排除通用批处理和 HPC 任务,适用范围清晰。
- 依赖已存在的 GKE Autopilot 集群、gcloud 认证和足够的 GPU/TPU 配额。
- 部分命令标记为 CLI-only,不能完全依赖列出的 MCP 工具。
- 源材料没有提供测试套件、平台验证范围或实际成本估算。
- 不同模型可能需要 Hugging Face token、PVC 或其他清单调整。
如何安装这个 Skill?
安装整个仓库中的技能集合:npx skills add google/skills。README 说明安装时可以选择该仓库中的特定技能,但没有说明单独安装 gke-inference 文件夹的命令或目标目录。
如何使用这个 Skill?
在已认证的 gcloud 环境和具备 GPU 工作负载支持的 GKE Autopilot 集群中,提出例如“在 GKE 上部署 Gemma 2 9B,使用 vLLM 和 NVIDIA L4,并生成推理清单”。技能可执行 gcloud container ai profiles models list --quiet、gcloud container ai profiles list --model=gemma-2-9b-it --quiet,再运行 manifest create 命令生成 inference.yaml;审查 Hugging Face token 和 PVC 等占位内容后,使用 kubectl apply -f inference.yaml 部署并监控 Pod。
这个 Skill 与同类方案有什么区别?
与仓库中的 gke-batch-hpc 技能相比,本技能专注于 GKE 上的 AI/ML 推理、模型服务和 LLM 自动扩缩容;通用批处理任务或 HPC 任务队列应使用 gke-batch-hpc。