SageMaker 模型部署规划器
为不同模型和流量需求选择合适的 AWS SageMaker 部署路径。
技能要求在创建端点前明确说明成本并等待用户确认,也要求检查配额并先进行 AWS/IAM 预检,降低未经同意的外部影响。扣分原因是未规定最小 IAM 权限、敏感模型或数据处理、凭证保护、部署失败回滚和完整数据流披露;发布者身份也未被验证。
工作流阶段和路径选择规则基本一致,并要求对未知的镜像 URI、SDK API 和配额进行检查。扣分原因是依赖多个未提供的技能,未给出本技能关键路径的测试、异常输入处理、失败诊断或可复现结果;静态证据不足以超过 10 分。
触发条件、目标用户、模型类型、流量与延迟问题及实时/异步边界描述较清晰,也明确说明 serverless、batch 和 Bedrock 路径未脚本化。扣分原因是非适用范围仍不完整,缺少中文支持说明,并依赖 Amazon SageMaker、AWS CLI 和相关海外服务,未说明中国大陆网络可达性。
文档按发现、路径选择、预检和部署分层,包含参数线索、实例选择示例、成本确认和仓库 README 中的 Apache-2.0 许可及生成校验流程。扣分原因是技能自身没有版本、变更记录、维护责任人、更新路径、FAQ、依赖安装说明或系统化限制与故障排查信息。
该技能能完成部署需求澄清、路径推荐、配额检查提示和向专用技能移交,核心规划价值明确。扣分原因是它不直接部署,最终输出依赖其他技能和外部环境;没有代表性输出、实际部署证据或与手工流程相比的效果验证,静态评估上限为 7 分。
固定 revision、README 的生成文件校验工作流、安全政策和明确的命令示例提供了有限审计线索。扣分原因是没有覆盖本技能关键路径的提交测试、第三方执行证据或多来源交叉验证,且静态阅读无法复现结论;因此不超过 5 分。
- 这是静态源文件审查,未执行任何命令、部署或测试;可靠性、效果和可验证性结论应谨慎解读。
- 使用前应确认 AWS 区域、SageMaker 配额、IAM 角色权限、模型和推理数据的敏感性,以及 AWS/Hugging Face 服务在目标网络环境中的可达性。
- 创建端点会产生费用并可能产生外部资源变更;必须保留用户确认、成本边界和失败后的清理/回滚方案。
这个 Skill 能做什么,适合哪些场景?
该技能帮助用户规划将模型部署到 Amazon SageMaker AI。它先确认模型来源、模型类型和流量形态,再在实时端点、无服务器、异步推理、批量转换和 Bedrock Custom Model Import 之间选择路径。它会根据延迟、流量、模型规模和成本因素给出部署建议,并协调 AWS 上下文、IAM、镜像选择和生产部署等后续技能。实时推理和异步推理是当前提供脚本支持的主要路径。
询问模型 ID、S3 工件路径或模型名称,并在必要时确认模型类型、调用频率、延迟容忍度和成本敏感度;根据请求特点选择 SageMaker 部署路径;提供实例类型建议,并要求通过 AWS CLI 检查 SageMaker 端点配额;在用户确认后,将工作交接给 AWS 上下文发现、Python 环境、IAM 预检、服务镜像选择和生产默认配置等技能。
- 希望把 Hugging Face 文本生成模型部署为 AWS 在线推理端点的团队。
- 需要在 SageMaker 上托管 embedding 或 reranker 模型的开发者。
- 需要为长时间运行、请求突发的文生图或视频生成任务规划异步推理的用户。
- 希望根据流量是否稳定、延迟要求和 GPU 配额选择实例类型的 AWS 用户。
- 只知道“把我微调的模型运行在 AWS 上”但尚未确定部署方案的用户。
这个 Skill 有哪些优点和局限?
- 覆盖 LLM、embedding、reranker、分类器和扩散模型等明确场景。
- 根据流量、延迟、推理时长和成本选择实时、异步等部署路径。
- 明确提醒先检查区域级端点配额,减少因 GPU 配额为零导致的部署失败。
- 遵循少量澄清问题和用户确认后再创建资源的流程。
- 技能本身主要负责发现和路径规划,后续部署依赖仓库中的其他技能。
- 无服务器、批量转换和 Bedrock Custom Model Import 在该工作流中没有脚本化部署路径。
- 未提供独立的测试套件、平台测试结果或当前 SageMaker 镜像 URI。
- 使用 AWS CLI 检查配额并部署到 SageMaker 需要相应 AWS 环境和权限。
如何安装这个 Skill?
从仓库的 skills/ 目录复制或建立符号链接,将 skills/hf-cloud-sagemaker-deployment-planner/ 放入 Codex 标准的 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。README 未提供该单个技能的独立安装命令;仓库整体也可按其说明通过 Claude Code 插件市场注册后安装,或使用 hf skills add <skill-name> 安装其他技能。
如何使用这个 Skill?
安装后直接提出 SageMaker 部署请求,例如:“Deploy my fine-tuned model to SageMaker”或“Host this embedding model on AWS”。技能通常会先询问模型和大致调用频率,然后给出部署路径和实例建议;在创建资源前等待用户确认。
这个 Skill 与同类方案有什么区别?
实时端点适合稳定流量和较低延迟,但稀疏流量可能产生闲置成本;无服务器适合间歇性流量,但冷启动和内存限制不适合较大的 LLM。异步推理适合长时间运行、大载荷或突发请求;批量转换适合离线数据集评分。Bedrock Custom Model Import 适合需要 Bedrock API 且模型架构受支持的场景,但不适合自定义推理逻辑。