自动化与运维 aws-sagemakerautoscalingcloudwatch-alarmsasync-inferencevllmteiaws-deployment

SageMaker 生产部署默认配置

为 SageMaker 实时或异步端点自动配置弹性伸缩、CloudWatch 告警和资源标签。

FollowSkills 评估 · FSRS-2.0
不推荐
46/ 100 五分制 2.3 / 5
信任安全12 / 25 · 2.4/5

证据显示默认启用自动扩缩容、CloudWatch 告警、统一标签,数据捕获默认关闭,并提供拆除命令且保留 IAM、S3 对象和模型工件;但会直接创建并持续计费的 SageMaker、S3、CloudWatch 和自动扩缩容资源,没有明确的用户确认步骤,接受任意镜像 URI、IAM Role ARN、环境变量和通知/S3 目标,且部署失败时缺少自动回滚,因此扣分。

可靠稳定7 / 20 · 1.8/5

脚本具有参数校验、状态等待、失败原因输出、BOM 处理和分阶段错误反馈,说明正常路径较完整;但没有提交测试套件,boto3/AWS CLI 依赖和 AWS API 行为未由文件验证,资源创建顺序可能在后续扩缩容或告警失败时留下孤儿资源,复用同名模型时也不校验配置一致性,因此扣分。

适用触发8 / 15 · 2.7/5

描述明确覆盖 SageMaker 实时和异步端点、vLLM/TEI、长任务和稀疏负载,并说明若干不适用场景及 Windows 用法;但触发边界、非 SageMaker 场景和区域/网络限制说明不足,核心功能依赖 AWS、S3、CloudWatch、SNS 及可能的 HF Hub,未证明对中国大陆网络和中文用户的可达性,因此扣分。

规范维护8 / 15 · 2.7/5

SKILL.md、设计参考、脚本、示例、默认值表、故障排查和拆除说明层次较好,命名及参数基本稳定,仓库提供 Apache-2.0;但选定技能自身没有版本、变更日志、维护责任人或更新路径,依赖安装说明不完整,未提供 FAQ、测试入口和已知 API 兼容性限制,因此扣分。

有效结果7 / 15 · 2.3/5

脚本覆盖模型、端点配置、实时/异步部署、扩缩容、告警、冒烟调用和拆除,并输出机器可读 JSON,静态证据支持其可完成核心部署任务;但没有执行验证,冒烟测试不是部署脚本强制步骤,默认参数可能造成成本或吞吐不匹配,且部分失败清理和异步无告警组合存在实际可用性风险,因此按静态上限并扣分。

证据核验4 / 10 · 2.0/5

代码、参数、默认值、日志和失败路径均可审计,README 与 LICENSE 提供有限仓库级背景;但没有提交测试套件、CI 覆盖或第三方执行记录,外部 AWS/Hugging Face 事实主要以文档断言呈现,无法静态复现关键云端行为,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 86cdeee824b7
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 部署前应确认镜像、IAM Role、环境变量、S3/SNS 目标及预期成本;这些参数可产生外部资源和持续费用。
  • 实时部署在 InService 后才注册扩缩容和告警,后续步骤失败可能留下计费资源;应检查状态并执行拆除。
  • 不要将 --no-alarms 与异步 min-capacity=0 组合使用,否则文件中的唤醒告警可能不会创建。
  • 数据捕获会把请求和响应写入 S3,可能包含敏感数据;启用前应确认权限、保留策略和合规要求。
  • 本评估未执行脚本,未验证 AWS API、依赖版本或端到端结果;发布者身份按未知处理。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是 Hugging Face Skills 仓库中的一个 SageMaker 部署技能,专门负责将已确定镜像 URI 和 IAM 角色的模型部署为生产端点。它会创建 SageMaker 模型、端点配置和端点,并默认配置自动伸缩、CloudWatch 告警和统一标签。技能同时支持实时推理与真正支持缩容至零的异步推理。部署后要求进行真实调用并检查 CloudWatch 日志,不能仅凭 InService 状态判断成功。

运行随技能提供的 scripts/deploy.py 创建实时 SageMaker 模型、端点配置和端点,注册基于每实例调用量的自动伸缩策略,并创建延迟、错误和平台开销告警;运行 scripts/deploy_async.py 创建异步端点、队列积压相关告警,以及支持 0→1 唤醒的目标追踪和阶梯伸缩策略。脚本可配置环境变量、实例类型、S3 模型工件、数据捕获、SNS 通知和容量范围,等待端点进入 InService,并输出包含资源名称和拆除命令的 JSON。invoke_endpoint.py 可验证实时调用并处理 JSON 与 UTF-8 BOM;异步端点通过 S3 上传输入、调用 invoke-endpoint-async 并轮询输出。

  1. 已准备好容器镜像、IAM 角色和区域信息,需要部署带自动伸缩和告警的实时 LLM 端点的团队。
  2. 运行 TEI 嵌入模型、希望将每实例调用目标调高以避免过度扩容的工程师。
  3. 处理长耗时、超大输入或稀疏批次,并希望异步 SageMaker 端点在空闲时缩容至零的团队。
  4. 需要在部署后验证真实推理,并排查 InService 但 Python worker 崩溃的 SageMaker 部署人员。
  5. 需要统一标签和安全拆除顺序,以便后续清理端点资源的 AWS 使用者。

这个 Skill 有哪些优点和局限?

优点
  • 实时和异步部署均默认包含自动伸缩、CloudWatch 告警和统一标签。
  • 异步模式原生支持 MinCapacity=0,并自动配置从零唤醒所需的阶梯伸缩。
  • 提供实时调用辅助脚本、异步调用流程、失败诊断规则和安全拆除脚本。
  • 数据捕获默认关闭,可避免未经请求的持续 S3 成本。
局限
  • 依赖已准备好的镜像 URI、可用 IAM 角色、AWS 区域及相应账户权限;它不是完整的 SageMaker 规划或前置检查技能。
  • 端点、CloudWatch、S3 和数据传输等实际 AWS 成本不由技能消除;启用数据捕获还需要额外的 S3 写权限。
  • 源材料没有提供自动化测试套件或跨平台测试结果。
  • 默认每实例 20 次调用的伸缩目标不适合高吞吐嵌入模型,通常需要手动调高。

如何安装这个 Skill?

从仓库的 skills/ 目录复制或 symlink hf-cloud-sagemaker-production-defaults 文件夹到 Codex 的标准 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills$HOME/.agents/skills。README 未提供该单个技能的专用安装命令;仓库整体也支持通过客户端加载 Agent Skills。若安装副本缺少 scripts/,应从源仓库获取,而不是根据说明重新实现。

如何使用这个 Skill?

在已完成 AWS 上下文、IAM 角色和镜像选择后,提示代理:“使用 SageMaker production defaults 技能部署这个模型,并在完成后执行 smoke test 和 CloudWatch worker-crash 日志检查。”实时端点可运行 python scripts/deploy.py --model-name <name> --image-uri <uri> --role-arn <role-arn> --instance-type <type> --region <region>;vLLM 还需按镜像标签提供环境变量,并在 cu130+ 镜像上提供 --inference-ami-version。异步端点使用 python scripts/deploy_async.py,并额外提供 --output-s3-uri。仅在真实调用成功且日志检查通过后报告完成;拆除可运行 python3 scripts/teardown.py <endpoint-name> <region>

这个 Skill 与同类方案有什么区别?

源材料没有提供与其他部署工具或技能的直接比较;它明确将自身定位为 SageMaker 部署流程的最后一步。

常见问题

这个技能会自动准备镜像和 IAM 角色吗?
不会。镜像 URI、IAM 角色、区域和实例类型应在此技能运行前确定;这些值分别来自镜像选择、IAM 预检查、AWS 上下文发现或用户/规划器。
为什么端点已经是 InService,却仍然无法推理?
InService 只表示容器响应了 `/ping`。必须执行一次真实调用,并扫描 `/aws/sagemaker/Endpoints/<endpoint-name>` 中的 `Worker died`、`Load model failed` 或 `ImportError` 标记。
异步端点是否真的能缩容到零?
可以。异步脚本默认 `--min-capacity 0`,并同时注册积压目标追踪策略和由 `HasBacklogWithoutCapacity` 告警触发的 0→1 阶梯伸缩策略。
部署完成后如何停止计费?
运行 `python3 scripts/teardown.py <endpoint-name> <region>`;脚本按告警、自动伸缩、端点、端点配置、模型的顺序删除资源,但不会删除 IAM 角色、S3 对象、SNS 主题或原始模型工件。

同仓库的其他 Skills

均来自 huggingface/skills

自动化与运维

SageMaker 模型部署规划器

为不同模型和流量需求选择合适的 AWS SageMaker 部署路径。

自动化与运维

SageMaker 服务镜像选择器

为 Hugging Face 模型选择兼容的 SageMaker 服务容器,并获取当前区域的镜像 URI。

自动化与运维

SageMaker 执行角色预检

在 SageMaker 部署或训练前发现并验证可用的 IAM 执行角色。

自动化与运维

SageMaker Python 环境管家

为 SageMaker 与 AWS 任务创建隔离且版本正确的 Python 环境。

数据与分析

Hugging Face 本地模型评测

在本地硬件上为 Hugging Face Hub 模型运行可控的 inspect-ai 或 lighteval 评测。

自动化与运维

AWS 云账户上下文发现

在 AWS 操作前准确识别本地配置、账户与身份。

开发与工程

LoRA Space Demo Builder

为 Hugging Face LoRA 自动设计并发布定制化 Gradio 演示 Space。

开发与工程

Hugging Face Spaces 构建器

帮助智能体创建、部署和维护 Hugging Face Spaces 应用。

开发与工程

Hugging Face 本地模型运行器

帮助你从 Hugging Face 选择合适的 GGUF 量化模型,并用 llama.cpp 在本机运行。

开发与工程

Hugging Face ZeroGPU 开发指南

帮助你构建可靠的 Gradio ZeroGPU AI 演示与 GPU 工作负载。

数据与分析

Hugging Face 数据集探索助手

通过 Dataset Viewer API 探索、检索和提取 Hugging Face 数据集。

开发与工程

Hugging Face 论文研究助手

读取 AI 论文并提取 Hugging Face 论文页的结构化元数据。

数据与分析

Hugging Face LLM 训练器

在 Hugging Face 云端 GPU 上训练、微调并保存模型。

数据与分析

TRL 大模型训练助手

用 TRL 命令行完成语言模型的监督微调、偏好对齐与强化学习训练。

数据与分析

Sentence Transformers 训练助手

为检索、相似度与稀疏搜索训练 Sentence Transformers 模型。

数据与分析

Transformers.js 浏览器与 Node.js 推理技能

在 JavaScript 应用中直接运行 Hugging Face 模型。

数据与分析

Hugging Face 模型内存估算器

在不下载权重的情况下估算模型推理所需内存。

数据与分析

Trackio 实验追踪

记录、监控并分析机器学习训练实验,让指标和诊断告警可供自动化工作流使用。

数据与分析

Hugging Face 视觉模型训练助手

在 Hugging Face Jobs 云 GPU 上训练检测、分类与分割视觉模型,并将结果保存到 Hub。

开发与工程

Hugging Face Hub CLI 技能

让智能体通过 hf 命令管理 Hugging Face Hub 上的模型、数据集、空间、作业与基础设施。

相关 Skills