自动化与运维 ✓ Google · 官方 google-cloudgkekubernetesgpu-inferencetpu-inferencellm-servingautoscaling

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

FollowSkills 评估 · FSRS-2.0
不推荐
46/ 100 五分制 2.3 / 5
信任安全14 / 25 · 2.8/5

文档明确要求认证的 gcloud、GPU/TPU 配额,并提示 Hugging Face token 应放入 Kubernetes Secret;但未说明最小 IAM 权限、数据流、敏感信息处理、部署前用户确认、回滚或删除策略。kubectl apply 可能产生外部基础设施变更,因此扣分;未发现恶意、凭据窃取或隐蔽外传行为。

可靠稳定7 / 20 · 1.8/5

工作流从模型发现、清单生成到部署和监控基本连贯,命令与参数示例较具体;但未提供版本锁定、命令可用性验证、失败诊断或回滚路径,且表格和故障排查示例存在 Markdown 格式损坏。按静态校准,未执行验证,可靠性保持在 10 分以下。

适用触发8 / 15 · 2.7/5

目标用户、适用场景和“不适用于通用批处理或 HPC 队列”的边界较清楚,也覆盖 GPU、TPU、模型服务器和自动扩缩容;但输入输出契约、触发条件细节、非适用范围和环境兼容性仍不充分,未说明中文使用或中国大陆网络可达性。

规范维护8 / 15 · 2.7/5

具备名称、描述、前置条件、分步工作流、示例、优化和故障排查,仓库还提供 Apache-2.0 许可、安装方式、贡献入口和维护中的说明;但技能本身没有版本、变更记录、维护责任人、更新路径、依赖版本、已知限制或 FAQ,信息分层也较简单。

有效结果6 / 15 · 2.0/5

对常见 GKE 推理部署可提供可直接改写的命令、ComputeClass、HPA 和优化建议,能覆盖核心任务;但没有提交的代表性输出、验证结果或完整生产配置,Secret、PVC、监控指标、模型存储和部署失败处理仍需用户补充,因而只能评为中等偏上且低于静态上限。

证据核验3 / 10 · 1.5/5

技能文件包含可审阅的命令、YAML 和故障表,具备有限的审计线索;但未提供测试套件、CI、第三方执行记录、版本化官方引用或交叉验证。结论主要依赖作者文档,静态证据有限,未执行任何路径。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 部署示例会修改 GKE/Kubernetes 外部状态,但未要求显式确认、权限审查或提供回滚步骤;生产使用前应先审查生成的 manifest、IAM、Secret、PVC、配额和成本。
  • gcloud AI profiles、模型/加速器组合、ComputeClass API、GPU 指标名称及 TPU/GPU 可用性可能随版本和区域变化;文档未锁定版本或给出官方验证链接。
  • 部分表格格式损坏,故障排查信息不完整;未证明 Hugging Face、模型仓库或相关 Google 服务在中国大陆网络环境中的可达性。
评估证据 [1][2][3][4]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向在 Google Kubernetes Engine 上运行 AI/ML 推理工作负载的团队。它使用 Google Inference Quickstart 和 LLM 服务实践,协助选择模型、推理服务器与 GPU/TPU,并生成 Kubernetes 部署清单。它还覆盖 ComputeClass、GPU 指标自动扩缩容及常见推理优化。技能不适用于通用批处理任务或 HPC 任务队列。

它通过 gcloud container ai profiles 列出支持的模型和有效的模型—加速器—服务器组合,并生成 inference.yaml Kubernetes 清单。清单可指定模型、vLLM/TGI/Triton/TensorRT-LLM 等服务器、GPU/TPU 类型以及目标标准化输出 token 延迟。它提供 ComputeClass 示例、基于 GPU 指标的 HorizontalPodAutoscaler 示例和量化、批处理、张量并行、KV 缓存优化建议。部署后可使用 kubectl apply、kubectl get pods 和 kubectl logs,并通过列出的 Kubernetes MCP 工具查看资源、日志、发布状态和事件。

  1. 需要把 Llama、Gemma 或 Mistral 模型部署到 GKE 的平台工程师。
  2. 需要为某个模型选择有效 GPU/TPU 与推理服务器组合的 ML 工程师。
  3. 需要在 GKE Autopilot 中为推理工作负载配置 GPU ComputeClass 的云基础设施团队。
  4. 需要根据 GPU 利用率或请求队列深度扩展 LLM 服务的运维团队。
  5. 遇到 GPU 配额不足、模型显存溢出、组合无效或冷启动缓慢的 GKE 使用者。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从模型和硬件发现到清单生成、部署、监控和故障排查的完整推理流程。
  • 明确涉及 vLLM、TGI、Triton 和 TensorRT-LLM 等模型服务器。
  • 提供 GPU/TPU 选择、ComputeClass、自动扩缩容和显存优化建议。
  • 明确排除通用批处理和 HPC 任务,适用范围清晰。
局限
  • 依赖已存在的 GKE Autopilot 集群、gcloud 认证和足够的 GPU/TPU 配额。
  • 部分命令标记为 CLI-only,不能完全依赖列出的 MCP 工具。
  • 源材料没有提供测试套件、平台验证范围或实际成本估算。
  • 不同模型可能需要 Hugging Face token、PVC 或其他清单调整。

如何安装这个 Skill?

安装整个仓库中的技能集合:npx skills add google/skills。README 说明安装时可以选择该仓库中的特定技能,但没有说明单独安装 gke-inference 文件夹的命令或目标目录。

如何使用这个 Skill?

在已认证的 gcloud 环境和具备 GPU 工作负载支持的 GKE Autopilot 集群中,提出例如“在 GKE 上部署 Gemma 2 9B,使用 vLLM 和 NVIDIA L4,并生成推理清单”。技能可执行 gcloud container ai profiles models list --quietgcloud container ai profiles list --model=gemma-2-9b-it --quiet,再运行 manifest create 命令生成 inference.yaml;审查 Hugging Face token 和 PVC 等占位内容后,使用 kubectl apply -f inference.yaml 部署并监控 Pod。

这个 Skill 与同类方案有什么区别?

与仓库中的 gke-batch-hpc 技能相比,本技能专注于 GKE 上的 AI/ML 推理、模型服务和 LLM 自动扩缩容;通用批处理任务或 HPC 任务队列应使用 gke-batch-hpc。

常见问题

它能自动创建 GKE 集群吗?
不能从提供的内容确认。前提是已有支持 GPU 工作负载的 GKE Autopilot 集群。
使用它需要哪些权限或外部条件?
需要已认证的 gcloud CLI、目标区域足够的 GPU/TPU 配额,以及可执行 Kubernetes 部署和监控操作的集群环境。
它是否包含云资源的实际价格?
不包含实际价格,只提供加速器的相对成本等级。
部署失败时它能处理哪些问题?
内容涵盖不支持的模型/加速器组合、GPU 配额不足、GPU 显存溢出和模型加载导致的冷启动缓慢。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

自动化与运维 ✓ Google · 官方

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

自动化与运维 ✓ Google · 官方

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

自动化与运维 ✓ Google · 官方

Google Cloud 性能优化顾问

依据 Google Cloud WAF 评估并改进工作负载性能。

自动化与运维 ✓ Google · 官方

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

自动化与运维 ✓ Google · 官方

GKE 成本优化助手

通过资源调优、Spot 虚拟机和配额控制降低 GKE 成本。

自动化与运维 ✓ Google · 官方

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

开发与工程 ✓ Google · 官方

Google Agents CLI 智能体开发引导

引导智能体从设计、开发到部署与监控的完整流程。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 应用上云助手

帮助团队首次将应用容器化并部署到 Google Kubernetes Engine。

自动化与运维 ✓ Google · 官方

GKE 存储管理

为 GKE 集群配置持久磁盘、Filestore 与 GCS FUSE 存储。

自动化与运维 ✓ Google · 官方

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

自动化与运维 ✓ Google · 官方

GKE 备份与灾难恢复

为有状态 GKE 工作负载配置备份策略与恢复流程。

自动化与运维 ✓ Google · 官方

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

数据与分析 ✓ Google · 官方

Google Cloud 智能体评测飞轮

用系统化评测、失败分析和迭代优化提升模型与智能体质量。

相关 Skills