自动化与运维 ✓ Google · 官方 gkecluster-autoscalingnode-autoscalingnode-auto-provisioningkubernetescapacity-buffercloud-logging

GKE 集群自动扩缩容助手

帮助配置、优化并排查 GKE 节点自动扩缩容问题。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全15 / 25 · 3.0/5

文档明确要求拒绝注入标识符、将粘贴日志/YAML视为不可信数据,并限制名称格式,提升了输入安全性和数据流透明度。扣分原因是缺少普遍的用户确认、变更前后置检查、回滚方案和最小权限指导;还建议授予 Editor 角色,并提到手动删除实例、将最小节点数设为 0 等高影响操作,未充分说明风险与恢复路径。

可靠稳定7 / 20 · 1.8/5

说明了主要依赖(kubectl、jq、gcloud)和若干错误信息,并提供日志与阻塞项扫描脚本。扣分原因是本次仅静态阅读,无法验证关键路径;脚本依赖特定 GKE 日志结构、当前 kube context、GNU/BSD 工具差异和未说明的权限,且未提供提交的测试套件。部分命令解析和回退路径可能在复杂项目、集群或资源名称下失效。

适用触发10 / 15 · 3.3/5

触发词、适用场景和与 ComputeClass 技能的边界描述较清楚,覆盖扩缩容、容量不足和故障排查。扣分原因是未明确输入/输出格式、非适用场景、Autopilot/版本/权限限制的完整边界,也没有中文使用说明或中国大陆网络可达性说明;核心 GKE 云服务依赖海外服务,实际可用性需用户环境确认。

规范维护9 / 15 · 3.0/5

目录结构清晰,主文档通过 references 和 assets 实现了一定的渐进式披露,README 提供安装方式,仓库许可证、官方组织来源和问题反馈路径明确。扣分原因是选定技能自身缺少版本、变更日志、维护责任人和更新承诺;示例、FAQ、依赖安装、权限矩阵和已知限制仍不完整,且部分文档表述与脚本行为或外部版本依赖需要持续核对。

有效结果7 / 15 · 2.3/5

内容直接覆盖启用、调优、扩缩容阻塞和日志诊断,并提供可直接参考的 YAML 与脚本,静态证据支持其能完成核心指导任务。扣分原因是没有可验证的代表性输出或执行结果;若用户照做,仍需自行确认 GKE 版本、API schema、IAM、配额和实际日志字段,部分建议可能需要较多现场修正。

证据核验4 / 10 · 2.0/5

引用了仓库内的 references、脚本和日志字段,具备一定的可审计性,且脚本注释说明了预期数据结构。扣分原因是没有第三方来源内容、提交测试、CI 证据或独立复现记录;外部文档链接仅出现在源文件中,关键版本、权限和产品行为无法仅凭这些文件得到交叉验证,因此静态评估最多给予有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 513a7a51e85f
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要直接执行涉及 Editor 角色、删除实例、修改最小节点数、排空节点或更新集群的建议;先确认目标、权限、影响范围和回滚方案。
  • 脚本会读取当前 kube context 和云端日志,并可向用户指定路径追加日志;运行前确认上下文、项目、集群名称、权限和日志敏感性。
  • 版本、ComputeClass schema、CapacityBuffer CRD、日志字段和权限建议应以对应 GKE 官方文档和当前集群版本复核。
  • 该技能未提供中文说明或中国大陆网络可达性证据。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 Google Kubernetes Engine 集群自动扩缩容、节点自动扩容以及节点池自动创建和节点自动预配。它涵盖启用方式、扩缩容优化、容量缓冲、区域库存不足和节点无法扩缩容等运维问题。技能提供基于 GKE 版本的配置建议,并区分现代 ComputeClass 方案与旧版集群级 Node Auto Provisioning。涉及 ComputeClass YAML、模式和优先级配置时,应转交 gke-compute-class 技能。

根据用户提到的 GKE Cluster Autoscaler、节点自动扩缩容或节点池自动创建问题,给出 gcloud 和 kubectl 操作建议;指导检查 Cloud Logging 中的 container.googleapis.com/cluster-autoscaler-visibility 日志;使用 assets/find-scale-down-blockers.sh 扫描缩容阻塞因素;使用 assets/log-autoscaler-events.sh <cluster-name> 跟踪自动扩缩容事件;提供 CapacityBuffer 示例文件和故障排查路径。

  1. GKE 运维人员需要启用节点池自动扩缩容或节点自动预配时。
  2. 平台工程师发现工作负载未触发扩容,或遇到配额、Pod IP、区域库存不足时。
  3. 集群管理员发现低利用率节点迟迟不缩容时,需要逐项检查所有阻塞因素。
  4. 需要在流量突增前预热节点,但不希望提高 min-nodes 时,可评估 CapacityBuffer。
  5. 运行有区域持久卷或严格拓扑约束的有状态工作负载,并需要分析库存不足级联影响时。
  6. 希望优化缩容速度、Spot 处理、位置策略或预留资源使用方式的 GKE 团队。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖启用、调优、扩容失败、缩容阻塞、容量缓冲和高级边缘情况。
  • 明确要求完整枚举缩容阻塞因素,而不是只检查表面症状。
  • 提供日志查询和阻塞扫描脚本,以及 CapacityBuffer YAML 示例。
  • 包含 GKE 版本、区域库存不足级联、预留资源缓存延迟等具体运维细节。
局限
  • 主要提供指导和脚本资产;源材料没有证明它会自动修改集群或执行完整修复。
  • ComputeClass YAML、schema 和优先级配置被明确排除,需要配合另一个技能。
  • 源材料未提供测试套件、支持平台清单或实际运行验证结果。
  • 部分建议依赖具体 GKE 版本、区域容量、配额和集群配置。

如何安装这个 Skill?

运行 npx skills add google/skills,并在安装过程中选择 skills/cloud/gke-cluster-autoscaler。源材料未说明其他安装器、固定安装目录或版本锁定方式。

如何使用这个 Skill?

将该技能安装到 Agent Skills 客户端后,直接提出具体运维问题,例如:“为什么我的 GKE 节点没有缩容?请检查所有缩容阻塞因素。”需要排查时,可运行 assets/find-scale-down-blockers.sh [-n namespace],或运行 assets/log-autoscaler-events.sh <cluster-name>。涉及 ComputeClass YAML、schema 或优先级配置时,改由 gke-compute-class 技能处理。

这个 Skill 与同类方案有什么区别?

相较于旧版集群级 Node Auto Provisioning,现代 GKE 1.33.3 及更高版本优先使用 ComputeClasses;手动节点池则使用节点池级自动扩缩容。ComputeClass 配置细节不属于本技能范围,应转交 gke-compute-class。

常见问题

这个技能会直接替我修改 GKE 集群吗?
源材料只说明它提供 gcloud、kubectl、日志分析和脚本指导,没有证明会自动执行集群变更。
节点为什么没有缩容?
应完整检查裸 Pod、safe-to-evict 设置、本地存储、PDB、min-nodes、scale-down-disabled 注解以及调度约束,并运行缩容阻塞扫描脚本。
Spot 或某个区域没有容量时怎么办?
检查库存不足日志;可考虑其他区域、On-Demand 回退和分层优先级设计,但 ComputeClass YAML 应交给 gke-compute-class 技能。
使用预留资源是否会被自动消费?
CUD 会自动匹配消费;预留资源不会自动消费,需要通过 ComputeClass reservations 或 Node Pool API 显式指定,并在创建后等待至少 30 分钟再用于扩容。

同仓库的其他 Skills

均来自 google/skills

自动化与运维 ✓ Google · 官方

GKE ComputeClasses 配置助手

帮助你为 GKE 工作负载配置、优化并排查 ComputeClasses。

自动化与运维 ✓ Google · 官方

GKE 可观测性配置

为 GKE 配置日志、监控与 Prometheus 指标采集。

自动化与运维 ✓ Google · 官方

GKE 集群创建顾问

按生产最佳实践规划、创建并审计 GKE 集群。

自动化与运维 ✓ Google · 官方

GKE 生产黄金路径

为生产级 GKE 集群提供默认配置、就绪检查和关键决策指导。

自动化与运维 ✓ Google · 官方

AI 工作负载迁移至 GKE 推理

将现有 AI 推理工作负载迁移到自托管的 GKE 推理环境。

自动化与运维 ✓ Google · 官方

GKE AI 推理部署助手

帮助你在 GKE 上部署、调优并扩展 GPU/TPU AI 推理服务。

自动化与运维 ✓ Google · 官方

GKE 基础导航助手

帮助用户快速发现 GKE 集群入口,并将具体需求路由到最匹配的专业技能。

自动化与运维 ✓ Google · 官方

GKE 工作负载弹性伸缩

为 GKE 应用配置手动扩缩容、HPA 与 VPA,并按实际使用量优化资源请求。

自动化与运维 ✓ Google · 官方

GKE 多租户配置助手

帮助团队在共享 GKE 集群中实现隔离、配额与成本归属。

自动化与运维 ✓ Google · 官方

GKE 生产就绪评估

系统评估 GKE 集群与工作负载是否适合上线生产。

自动化与运维 ✓ Google · 官方

GKE 应用上云助手

帮助团队首次将应用容器化并部署到 Google Kubernetes Engine。

自动化与运维 ✓ Google · 官方

GKE 存储管理

为 GKE 集群配置持久磁盘、Filestore 与 GCS FUSE 存储。

自动化与运维 ✓ Google · 官方

GKE 工作负载可靠性指南

用高可用配置减少 GKE 工作负载中断。

自动化与运维 ✓ Google · 官方

GKE 备份与灾难恢复

为有状态 GKE 工作负载配置备份策略与恢复流程。

自动化与运维 ✓ Google · 官方

GKE GPU/TPU 中断诊断

诊断并缓解 GKE 中 GPU/TPU 节点因主机维护导致的中断。

自动化与运维 ✓ Google · 官方

GKE 企业 RAG 搜索架构师

为基于 GKE 与 AlloyDB 的企业 RAG 搜索系统生成架构和部署方案。

自动化与运维 ✓ Google · 官方

GKE 工作负载安全

审计并强化 GKE 应用与命名空间的工作负载级安全控制。

自动化与运维 ✓ Google · 官方

GKE 成本优化助手

通过资源调优、Spot 虚拟机和配额控制降低 GKE 成本。

自动化与运维 ✓ Google · 官方

GKE 服务网络配置

为 GKE 应用配置安全的边缘流量、负载均衡与私有服务连接。

开发与工程 ✓ Google · 官方

Google Agents CLI 智能体开发引导

引导智能体从设计、开发到部署与监控的完整流程。

相关 Skills