自动化与运维 amazon-sagemakeraws-deploymentmodel-servingreal-time-inferenceasync-inferenceendpoint-planning

SageMaker 模型部署规划器

为不同模型和流量需求选择合适的 AWS SageMaker 部署路径。

FollowSkills 评估 · FSRS-2.0
不推荐
50/ 100 五分制 2.5 / 5
信任安全14 / 25 · 2.8/5

技能要求在创建端点前明确说明成本并等待用户确认,也要求检查配额并先进行 AWS/IAM 预检,降低未经同意的外部影响。扣分原因是未规定最小 IAM 权限、敏感模型或数据处理、凭证保护、部署失败回滚和完整数据流披露;发布者身份也未被验证。

可靠稳定8 / 20 · 2.0/5

工作流阶段和路径选择规则基本一致,并要求对未知的镜像 URI、SDK API 和配额进行检查。扣分原因是依赖多个未提供的技能,未给出本技能关键路径的测试、异常输入处理、失败诊断或可复现结果;静态证据不足以超过 10 分。

适用触发10 / 15 · 3.3/5

触发条件、目标用户、模型类型、流量与延迟问题及实时/异步边界描述较清晰,也明确说明 serverless、batch 和 Bedrock 路径未脚本化。扣分原因是非适用范围仍不完整,缺少中文支持说明,并依赖 Amazon SageMaker、AWS CLI 和相关海外服务,未说明中国大陆网络可达性。

规范维护8 / 15 · 2.7/5

文档按发现、路径选择、预检和部署分层,包含参数线索、实例选择示例、成本确认和仓库 README 中的 Apache-2.0 许可及生成校验流程。扣分原因是技能自身没有版本、变更记录、维护责任人、更新路径、FAQ、依赖安装说明或系统化限制与故障排查信息。

有效结果6 / 15 · 2.0/5

该技能能完成部署需求澄清、路径推荐、配额检查提示和向专用技能移交,核心规划价值明确。扣分原因是它不直接部署,最终输出依赖其他技能和外部环境;没有代表性输出、实际部署证据或与手工流程相比的效果验证,静态评估上限为 7 分。

证据核验4 / 10 · 2.0/5

固定 revision、README 的生成文件校验工作流、安全政策和明确的命令示例提供了有限审计线索。扣分原因是没有覆盖本技能关键路径的提交测试、第三方执行证据或多来源交叉验证,且静态阅读无法复现结论;因此不超过 5 分。

证据充分度: 评估于 2026年7月20日 审查版本 86cdeee824b7
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 这是静态源文件审查,未执行任何命令、部署或测试;可靠性、效果和可验证性结论应谨慎解读。
  • 使用前应确认 AWS 区域、SageMaker 配额、IAM 角色权限、模型和推理数据的敏感性,以及 AWS/Hugging Face 服务在目标网络环境中的可达性。
  • 创建端点会产生费用并可能产生外部资源变更;必须保留用户确认、成本边界和失败后的清理/回滚方案。
评估证据 [1][2][3][4][5]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能帮助用户规划将模型部署到 Amazon SageMaker AI。它先确认模型来源、模型类型和流量形态,再在实时端点、无服务器、异步推理、批量转换和 Bedrock Custom Model Import 之间选择路径。它会根据延迟、流量、模型规模和成本因素给出部署建议,并协调 AWS 上下文、IAM、镜像选择和生产部署等后续技能。实时推理和异步推理是当前提供脚本支持的主要路径。

询问模型 ID、S3 工件路径或模型名称,并在必要时确认模型类型、调用频率、延迟容忍度和成本敏感度;根据请求特点选择 SageMaker 部署路径;提供实例类型建议,并要求通过 AWS CLI 检查 SageMaker 端点配额;在用户确认后,将工作交接给 AWS 上下文发现、Python 环境、IAM 预检、服务镜像选择和生产默认配置等技能。

  1. 希望把 Hugging Face 文本生成模型部署为 AWS 在线推理端点的团队。
  2. 需要在 SageMaker 上托管 embedding 或 reranker 模型的开发者。
  3. 需要为长时间运行、请求突发的文生图或视频生成任务规划异步推理的用户。
  4. 希望根据流量是否稳定、延迟要求和 GPU 配额选择实例类型的 AWS 用户。
  5. 只知道“把我微调的模型运行在 AWS 上”但尚未确定部署方案的用户。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 LLM、embedding、reranker、分类器和扩散模型等明确场景。
  • 根据流量、延迟、推理时长和成本选择实时、异步等部署路径。
  • 明确提醒先检查区域级端点配额,减少因 GPU 配额为零导致的部署失败。
  • 遵循少量澄清问题和用户确认后再创建资源的流程。
局限
  • 技能本身主要负责发现和路径规划,后续部署依赖仓库中的其他技能。
  • 无服务器、批量转换和 Bedrock Custom Model Import 在该工作流中没有脚本化部署路径。
  • 未提供独立的测试套件、平台测试结果或当前 SageMaker 镜像 URI。
  • 使用 AWS CLI 检查配额并部署到 SageMaker 需要相应 AWS 环境和权限。

如何安装这个 Skill?

从仓库的 skills/ 目录复制或建立符号链接,将 skills/hf-cloud-sagemaker-deployment-planner/ 放入 Codex 标准的 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。README 未提供该单个技能的独立安装命令;仓库整体也可按其说明通过 Claude Code 插件市场注册后安装,或使用 hf skills add <skill-name> 安装其他技能。

如何使用这个 Skill?

安装后直接提出 SageMaker 部署请求,例如:“Deploy my fine-tuned model to SageMaker”或“Host this embedding model on AWS”。技能通常会先询问模型和大致调用频率,然后给出部署路径和实例建议;在创建资源前等待用户确认。

这个 Skill 与同类方案有什么区别?

实时端点适合稳定流量和较低延迟,但稀疏流量可能产生闲置成本;无服务器适合间歇性流量,但冷启动和内存限制不适合较大的 LLM。异步推理适合长时间运行、大载荷或突发请求;批量转换适合离线数据集评分。Bedrock Custom Model Import 适合需要 Bedrock API 且模型架构受支持的场景,但不适合自定义推理逻辑。

常见问题

它会自动创建 SageMaker 端点吗?
不会仅凭规划就创建资源。它先给出路径和成本相关的实例建议,并等待用户确认,再交接给生产部署技能。
需要提供哪些信息?
通常需要模型 ID、S3 工件路径或模型名称,以及大致调用频率。模型类型、延迟和成本信息会在确有必要时进一步询问。
为什么部署前要检查配额?
SageMaker 端点配额按区域和实例类型计算,许多账户的 GPU 默认配额为零;未检查可能导致 ResourceLimitExceeded。
它适合所有 SageMaker 部署方式吗?
它可以规划多种路径,但当前脚本化流程主要覆盖实时端点和异步推理,其他路径需要简要交接而不是通过该工作流直接部署。

同仓库的其他 Skills

均来自 huggingface/skills

自动化与运维

SageMaker 生产部署默认配置

为 SageMaker 实时或异步端点自动配置弹性伸缩、CloudWatch 告警和资源标签。

自动化与运维

SageMaker 服务镜像选择器

为 Hugging Face 模型选择兼容的 SageMaker 服务容器,并获取当前区域的镜像 URI。

自动化与运维

SageMaker 执行角色预检

在 SageMaker 部署或训练前发现并验证可用的 IAM 执行角色。

开发与工程

LoRA Space Demo Builder

为 Hugging Face LoRA 自动设计并发布定制化 Gradio 演示 Space。

自动化与运维

AWS 云账户上下文发现

在 AWS 操作前准确识别本地配置、账户与身份。

开发与工程

Hugging Face Spaces 构建器

帮助智能体创建、部署和维护 Hugging Face Spaces 应用。

自动化与运维

SageMaker Python 环境管家

为 SageMaker 与 AWS 任务创建隔离且版本正确的 Python 环境。

数据与分析

Hugging Face 本地模型评测

在本地硬件上为 Hugging Face Hub 模型运行可控的 inspect-ai 或 lighteval 评测。

开发与工程

Hugging Face 本地模型运行器

帮助你从 Hugging Face 选择合适的 GGUF 量化模型,并用 llama.cpp 在本机运行。

数据与分析

Hugging Face LLM 训练器

在 Hugging Face 云端 GPU 上训练、微调并保存模型。

数据与分析

Sentence Transformers 训练助手

为检索、相似度与稀疏搜索训练 Sentence Transformers 模型。

开发与工程

Hugging Face Hub CLI 技能

让智能体通过 hf 命令管理 Hugging Face Hub 上的模型、数据集、空间、作业与基础设施。

数据与分析

Hugging Face 模型优选器

根据任务、基准成绩和设备内存筛选并推荐合适的 AI 模型。

开发与工程

Hugging Face API 工具构建器

把 Hugging Face API 调用组合成可复用、可管道化的命令行工具。

开发与工程

Hugging Face MCP 助手

通过 MCP 让智能体直接搜索、阅读并使用 Hugging Face Hub 资源。

开发与工程

Hugging Face ZeroGPU 开发指南

帮助你构建可靠的 Gradio ZeroGPU AI 演示与 GPU 工作负载。

数据与分析

Hugging Face 数据集探索助手

通过 Dataset Viewer API 探索、检索和提取 Hugging Face 数据集。

开发与工程

Hugging Face 论文研究助手

读取 AI 论文并提取 Hugging Face 论文页的结构化元数据。

数据与分析

TRL 大模型训练助手

用 TRL 命令行完成语言模型的监督微调、偏好对齐与强化学习训练。

数据与分析

Transformers.js 浏览器与 Node.js 推理技能

在 JavaScript 应用中直接运行 Hugging Face 模型。

相关 Skills