自动化与运维 ✓ Google · 官方 gkekuberneteshpavpaworkload-autoscalingrightsizing

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

FollowSkills 评估 · FSRS-2.0
不推荐
49/ 100 五分制 2.5 / 5
信任安全14 / 25 · 2.8/5

技能明确限定于 GKE 工作负载扩缩容,并说明 HPA、VPA 的重启和驱逐风险;但 kubectl scale、autoscale、gcloud update 和 Auto 模式会产生外部集群变更,未要求用户确认、未提供回滚步骤或权限最小化说明,故扣分。未见凭据处理或隐蔽数据外传。

可靠稳定7 / 20 · 1.8/5

工作流、示例清单和验证命令基本一致,涵盖手动扩容、HPA、VPA 及部分前置条件;但未提供错误处理、异常输入反馈、兼容性核验或测试证据,且若干 GKE 版本和 Metrics Server 断言无法由文件静态确认,故限于中低分。

适用触发10 / 15 · 3.3/5

名称、受众和适用场景清楚,并明确排除 Cluster Autoscaler、静态集群 sizing 和节点机器样式配置;但输入要求、环境前提、非适用边界和触发细节仍不完整,也没有中文使用或中国大陆网络可达性说明,故扣分。

规范维护8 / 15 · 2.7/5

文档结构清晰,采用工作流、最佳实践和 assets 模板渐进展开;仓库提供安装方式、Apache-2.0 许可证、问题反馈入口和活跃开发声明。但技能自身没有版本、变更记录、明确维护负责人或完整故障排查,README 中链接路径与评估路径名称不一致,故扣分。

有效结果7 / 15 · 2.3/5

命令和 HPA/VPA YAML 模板可直接作为起点,覆盖核心扩缩容任务,并给出 rightsizing 流程;但模板使用通用名称和默认命名空间,缺少完整生产前检查、回滚和验证覆盖,静态审阅无法证明结果可直接运行,因此按静态上限给分。

证据核验3 / 10 · 1.5/5

源文件、示例 YAML、README、许可证和固定修订信息提供了可审计材料;但未提供覆盖关键路径的测试套件、CI 执行结果或第三方复现证据,结论主要来自静态文档,故仅给有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行扩容或启用 VPA 前应明确确认目标集群、命名空间、部署对象和副作用,并准备可验证的回滚方案。
  • 应核实 GKE 版本、Metrics Server、VPA 支持情况及 HPA/VPA 指标冲突;示例清单中的通用名称和 default 命名空间不能直接视为生产配置。
  • README 将技能链接指向 gke-scaling,而评估路径为 gke-workload-scaling,安装或发现技能时需确认路径映射。
评估证据 [1][2][3][4][5][6]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 Google Kubernetes Engine 上应用工作负载的扩缩容。它涵盖 Deployment 手动调整副本数、基于指标的 Horizontal Pod Autoscaler(HPA)以及用于资源调优的 Vertical Pod Autoscaler(VPA)。内容包括配置前提、kubectl 与 gcloud 命令、YAML 模板和扩缩容最佳实践。它不处理 Cluster Autoscaler、静态集群 sizing 或节点级机器样式配置。

指导用户使用 kubectl scale 调整 Deployment 副本数,使用 kubectl autoscale 或 HPA YAML 创建水平自动扩缩容,使用 kubectl get 验证 Deployment 和 HPA 状态;指导在 Standard GKE 集群中通过 gcloud 启用 VPA,并配置 Off、Initial、Auto 或 InPlaceOrRecreate 模式;指导使用 kubectl describe vpa 读取建议,将 target 值与现有 requests 比较,并按 20% 缓冲计算新的资源请求。

  1. GKE 应用运维人员需要立即将某个 Deployment 扩展到固定副本数以应对测试或临时干预。
  2. 平台工程师希望根据 CPU、内存或自定义指标自动调整应用 Pod 数量。
  3. 团队需要根据实际 CPU 和内存使用量为 GKE 工作负载重新设定资源请求。
  4. 使用 VPA 的团队希望先运行 24 小时以上的 Off 模式,再审查资源建议并逐步应用。

这个 Skill 有哪些优点和局限?

优点
  • 同时覆盖手动扩缩容、HPA 和 VPA,适合常见的 GKE 工作负载伸缩任务。
  • 提供可复制的 kubectl 和 gcloud 命令,以及 HPA/VPA YAML 模板路径。
  • 包含资源请求、指标冲突、PDB、HPA 延迟和 VPA 重启风险等操作注意事项。
  • 提供基于 P95 使用量和 20% 缓冲的 rightsizing 流程。
局限
  • 不覆盖 Cluster Autoscaler、静态集群容量或节点级机器配置。
  • HPA 依赖 Metrics Server,HPA/VPA 还依赖准确的资源 requests;这些前提未满足时无法直接得到可靠结果。
  • VPA 的 Auto 模式可能重启运行中的 Pod,源材料要求应用能够优雅处理 SIGTERM。
  • 源材料未提供测试套件、版本兼容性矩阵或完整的集群认证流程。

如何安装这个 Skill?

运行 npx skills add google/skills,并在安装过程中选择所需技能。README 未说明具体安装目录或选择该技能的命令行参数;该技能位于 skills/cloud/gke-workload-scaling/SKILL.md。

如何使用这个 Skill?

在已安装该技能的 Agent Skills 客户端中,可使用类似“为 GKE 中的 deployment_name 配置 HPA,最小 1 个 Pod、最大 10 个 Pod,并检查资源请求”的请求触发它。执行前应准备可访问的 GKE 集群、kubectl,以及需要启用 VPA 时准备 gcloud CLI;具体集群认证步骤未在源材料中说明。

这个 Skill 与同类方案有什么区别?

该技能将 HPA 用于调整 Pod 数量,将 VPA 用于调整 Pod 的 CPU 和内存资源;它建议避免让 HPA 与 VPA 使用同一指标。它明确区别于 Cluster Autoscaler,后者不在本技能范围内。

常见问题

使用这个技能是否需要额外付费?
源材料未说明该技能本身的费用;它提供的是 Agent Skill 文档和工作流。GKE、Cloud Monitoring 或其他云资源的费用未在源材料中说明。
使用 HPA 前必须准备什么?
需要运行 Metrics Server,并为容器定义清晰的资源 requests 和 limits;源材料称 Metrics Server 在 GKE 上默认启用。
VPA Auto 模式会不会造成服务中断?
Auto 模式可能通过重启 Pod 调整资源。源材料还指出,VPA 默认通常要求至少 2 个副本才执行驱逐,以降低唯一副本被驱逐导致停机的风险。
这个技能能配置节点自动扩容吗?
不能。它明确不用于 Cluster Autoscaler、静态集群 sizing 或直接配置节点级机器样式。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

自动化与运维 ✓ Google · 官方

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

自动化与运维 ✓ Google · 官方

GKE 应用上云助手

帮助团队首次将应用容器化并部署到 Google Kubernetes Engine。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

自动化与运维 ✓ Google · 官方

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

自动化与运维 ✓ Google · 官方

GKE 存储管理

为 GKE 集群配置持久磁盘、Filestore 与 GCS FUSE 存储。

自动化与运维 ✓ Google · 官方

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

自动化与运维 ✓ Google · 官方

GKE 备份与灾难恢复

为有状态 GKE 工作负载配置备份策略与恢复流程。

自动化与运维 ✓ Google · 官方

GKE 工作负载安全

审计并强化 GKE 应用与命名空间的工作负载级安全控制。

自动化与运维 ✓ Google · 官方

GKE 成本优化助手

通过资源调优、Spot 虚拟机和配额控制降低 GKE 成本。

自动化与运维 ✓ Google · 官方

GKE 批处理与 HPC 工作负载

在 GKE 上配置、调度并运行批处理、并行计算和 HPC 作业。

自动化与运维 ✓ Google · 官方

GKE 平台安全加固

帮助平台团队规划并实施 GKE 集群级安全加固。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

自动化与运维 ✓ Google · 官方

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

相关 Skills