AI 工作负载迁移至 GKE 推理
将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。
技能明确要求先获准进行只读发现,默认不执行变更,并对外部暴露、Workload Identity、令牌处理和内部负载均衡作出安全约束;但未提供完整回滚方案、镜像摘要固定、依赖安全验证或完整数据流说明,因此扣分。
四阶段流程、检查清单和异常分流较清楚,但源文件在 VRAM 公式部分截断,所需 assets 未提供,且静态审查无法复现命令、模板生成和验证路径;按静态上限限制,扣除测试、边界和故障反馈不足的分数。
触发条件、迁移与新部署边界、MCP 分流和主要输入较明确;但未说明中文交互支持,也未证明中国大陆网络可达性,且依赖 Google Cloud、Hugging Face 和外部文档,故扣分。
名称、描述、分阶段结构、安装入口、Apache-2.0 许可和仓库支持渠道清楚;但技能自身缺少版本号、变更日志、FAQ、维护负责人和明确更新路径,assets 依赖也未在给定材料中完整呈现,因此扣分。
技能覆盖发现、设计、部署和验证,并包含较具体的 GKE、vLLM、存储、网关和密钥操作指导;但关键模板和文件内容未提供,公式说明被截断,静态证据不足以证明能直接产出可用迁移结果,故仅给有限分数。
存在具体命令、模板文件名、检查清单和外部参考链接,具备一定审计线索;但未提供针对该技能的测试套件、CI 覆盖或第三方执行证据,且无法在静态审查中复现关键路径,因此扣分。
- 源文件证据在 VRAM sizing 公式部分不完整,且所需 assets 未随评估材料提供;不要假设模板、参数或公式后续内容完整。
- 执行前应核实 gcloud/kubectl 权限范围、Workload Identity、镜像标签、GPU 配额、外部文档可达性及回滚方案。
- 外部暴露 vLLM 端点前必须配置认证或严格访问控制;不要把 Hugging Face 或其他令牌写入提示词、清单或日志。
这个 Skill 能做什么,适合哪些场景?
该技能面向已经运行在 Cloud Run、Gemini API、Gemini Enterprise Agent Platform 或自定义虚拟机上的 AI 推理工作负载。它通过四阶段流程完成需求发现、架构设计、实施以及验证和流量切换。技能会使用 gcloud 和 kubectl 检查资源、设计 GPU 或 TPU、存储和网络配置,并生成 Kubernetes 清单。它不适用于从零开始的新 GKE 推理部署,也不负责通过 Gemini Cloud Assist MCP 自动执行迁移。
在获得许可后,使用 gcloud 的 list 和 describe 命令检查 Cloud Run 服务、GKE 集群、Vertex AI 端点和 Cloud Storage;收集模型、硬件、存储、流量和自动扩缩容需求;按参数量、KV 缓存和安全余量计算显存;规划 vLLM、Custom Compute Classes、Workload Identity、Cloud Storage FUSE 或 Managed Lustre、Gateway API 和 Prometheus;生成 vLLM Deployment、ComputeClass、Gateway、存储配置和模型暂存 Job 等 YAML 文件;提供 kubectl 应用、等待、日志、滚动发布、端口转发和推理验证命令,并给出流量切换和回滚建议。
- 运行在 Cloud Run 上的 AI 推理服务需要迁移到自托管 GKE,以获得对 GPU 节点和推理栈的更多控制。
- 使用 Gemini API 或 Gemini Enterprise Agent Platform 的团队希望评估并迁移到 GKE 上的开放权重模型。
- 已有自定义虚拟机推理工作负载的云平台工程师,需要规划 GKE 硬件、模型存储和流量切换。
- 需要为现有大型模型推理服务设计 vLLM、GPU、模型暂存和内部 Gateway 的团队。
这个 Skill 有哪些优点和局限?
- 覆盖从发现到验证和流量切换的完整迁移流程。
- 明确区分只读检查与会修改云资源的命令。
- 包含 GPU 显存估算、模型暂存、Workload Identity、Gateway 和回滚等具体指导。
- 对 Hugging Face 令牌、外部暴露和未经身份验证的推理端点给出安全限制。
- 只服务于已有工作负载迁移,不适合全新 GKE 推理部署。
- 依赖 gcloud、kubectl、可访问的 Google Cloud 环境以及本地文件写入能力。
- 源材料没有提供测试套件、自动化验证结果或实际平台兼容性测试证据。
- 默认流程仍需要用户确认发现结果、设计方案和最终迁移状态。
如何安装这个 Skill?
运行 npx skills add google/skills,然后在安装流程中选择该仓库中的 skills/cloud/google-cloud-solution-guided-gke-ai-migration 技能。README 未说明更具体的客户端安装目录或版本要求。
如何使用这个 Skill?
在已安装该技能的 Agent Skills 客户端中,提出类似“将现有的 Cloud Run AI 推理服务迁移到 GKE,并先进行环境发现”的请求。首次发现前需要明确授权技能执行只读 gcloud 检查;后续阶段默认生成文件和命令供用户执行,除非用户明确要求 Agent 执行变更操作。该技能要求在当前目录保存 migration-state.md 和生成的 YAML 清单,但源材料未提供完整的触发语法或示例仓库模板文件。
这个 Skill 与同类方案有什么区别?
与同仓库的 gke-inference 技能相比,本技能专注于从 Cloud Run、Gemini API、Agent Platform 或其他已有平台迁移到 GKE;gke-inference 用于从零部署新的 GKE AI 模型服务器。若用户希望自动化基础设施分析或资源变更,源材料将 Gemini Cloud Assist MCP server 作为替代路径。