GKE 集群自动扩缩容助手
帮助配置、优化并排查 GKE 节点自动扩缩容问题。
文档明确要求拒绝注入标识符、将粘贴日志/YAML视为不可信数据,并限制名称格式,提升了输入安全性和数据流透明度。扣分原因是缺少普遍的用户确认、变更前后置检查、回滚方案和最小权限指导;还建议授予 Editor 角色,并提到手动删除实例、将最小节点数设为 0 等高影响操作,未充分说明风险与恢复路径。
说明了主要依赖(kubectl、jq、gcloud)和若干错误信息,并提供日志与阻塞项扫描脚本。扣分原因是本次仅静态阅读,无法验证关键路径;脚本依赖特定 GKE 日志结构、当前 kube context、GNU/BSD 工具差异和未说明的权限,且未提供提交的测试套件。部分命令解析和回退路径可能在复杂项目、集群或资源名称下失效。
触发词、适用场景和与 ComputeClass 技能的边界描述较清楚,覆盖扩缩容、容量不足和故障排查。扣分原因是未明确输入/输出格式、非适用场景、Autopilot/版本/权限限制的完整边界,也没有中文使用说明或中国大陆网络可达性说明;核心 GKE 云服务依赖海外服务,实际可用性需用户环境确认。
目录结构清晰,主文档通过 references 和 assets 实现了一定的渐进式披露,README 提供安装方式,仓库许可证、官方组织来源和问题反馈路径明确。扣分原因是选定技能自身缺少版本、变更日志、维护责任人和更新承诺;示例、FAQ、依赖安装、权限矩阵和已知限制仍不完整,且部分文档表述与脚本行为或外部版本依赖需要持续核对。
内容直接覆盖启用、调优、扩缩容阻塞和日志诊断,并提供可直接参考的 YAML 与脚本,静态证据支持其能完成核心指导任务。扣分原因是没有可验证的代表性输出或执行结果;若用户照做,仍需自行确认 GKE 版本、API schema、IAM、配额和实际日志字段,部分建议可能需要较多现场修正。
引用了仓库内的 references、脚本和日志字段,具备一定的可审计性,且脚本注释说明了预期数据结构。扣分原因是没有第三方来源内容、提交测试、CI 证据或独立复现记录;外部文档链接仅出现在源文件中,关键版本、权限和产品行为无法仅凭这些文件得到交叉验证,因此静态评估最多给予有限分数。
- 不要直接执行涉及 Editor 角色、删除实例、修改最小节点数、排空节点或更新集群的建议;先确认目标、权限、影响范围和回滚方案。
- 脚本会读取当前 kube context 和云端日志,并可向用户指定路径追加日志;运行前确认上下文、项目、集群名称、权限和日志敏感性。
- 版本、ComputeClass schema、CapacityBuffer CRD、日志字段和权限建议应以对应 GKE 官方文档和当前集群版本复核。
- 该技能未提供中文说明或中国大陆网络可达性证据。
这个 Skill 能做什么,适合哪些场景?
该技能面向 Google Kubernetes Engine 集群自动扩缩容、节点自动扩容以及节点池自动创建和节点自动预配。它涵盖启用方式、扩缩容优化、容量缓冲、区域库存不足和节点无法扩缩容等运维问题。技能提供基于 GKE 版本的配置建议,并区分现代 ComputeClass 方案与旧版集群级 Node Auto Provisioning。涉及 ComputeClass YAML、模式和优先级配置时,应转交 gke-compute-class 技能。
根据用户提到的 GKE Cluster Autoscaler、节点自动扩缩容或节点池自动创建问题,给出 gcloud 和 kubectl 操作建议;指导检查 Cloud Logging 中的 container.googleapis.com/cluster-autoscaler-visibility 日志;使用 assets/find-scale-down-blockers.sh 扫描缩容阻塞因素;使用 assets/log-autoscaler-events.sh <cluster-name> 跟踪自动扩缩容事件;提供 CapacityBuffer 示例文件和故障排查路径。
- GKE 运维人员需要启用节点池自动扩缩容或节点自动预配时。
- 平台工程师发现工作负载未触发扩容,或遇到配额、Pod IP、区域库存不足时。
- 集群管理员发现低利用率节点迟迟不缩容时,需要逐项检查所有阻塞因素。
- 需要在流量突增前预热节点,但不希望提高 min-nodes 时,可评估 CapacityBuffer。
- 运行有区域持久卷或严格拓扑约束的有状态工作负载,并需要分析库存不足级联影响时。
- 希望优化缩容速度、Spot 处理、位置策略或预留资源使用方式的 GKE 团队。
这个 Skill 有哪些优点和局限?
- 覆盖启用、调优、扩容失败、缩容阻塞、容量缓冲和高级边缘情况。
- 明确要求完整枚举缩容阻塞因素,而不是只检查表面症状。
- 提供日志查询和阻塞扫描脚本,以及 CapacityBuffer YAML 示例。
- 包含 GKE 版本、区域库存不足级联、预留资源缓存延迟等具体运维细节。
- 主要提供指导和脚本资产;源材料没有证明它会自动修改集群或执行完整修复。
- ComputeClass YAML、schema 和优先级配置被明确排除,需要配合另一个技能。
- 源材料未提供测试套件、支持平台清单或实际运行验证结果。
- 部分建议依赖具体 GKE 版本、区域容量、配额和集群配置。
如何安装这个 Skill?
运行 npx skills add google/skills,并在安装过程中选择 skills/cloud/gke-cluster-autoscaler。源材料未说明其他安装器、固定安装目录或版本锁定方式。
如何使用这个 Skill?
将该技能安装到 Agent Skills 客户端后,直接提出具体运维问题,例如:“为什么我的 GKE 节点没有缩容?请检查所有缩容阻塞因素。”需要排查时,可运行 assets/find-scale-down-blockers.sh [-n namespace],或运行 assets/log-autoscaler-events.sh <cluster-name>。涉及 ComputeClass YAML、schema 或优先级配置时,改由 gke-compute-class 技能处理。
这个 Skill 与同类方案有什么区别?
相较于旧版集群级 Node Auto Provisioning,现代 GKE 1.33.3 及更高版本优先使用 ComputeClasses;手动节点池则使用节点池级自动扩缩容。ComputeClass 配置细节不属于本技能范围,应转交 gke-compute-class。