SageMaker 服务镜像选择器
为 Hugging Face 模型选择兼容的 SageMaker 服务容器,并获取当前区域的镜像 URI。
技能明确要求从AWS官方DLC目录读取URI,并提示令牌、VPC、区域和镜像来源;但部署与镜像脚本会创建ECR仓库、登录公共/私有注册表、拉取并推送镜像,未要求用户确认、未提供回滚或最小权限说明,也未充分说明敏感令牌的数据流,因此扣分。
文档提供了较完整的决策表、环境变量、AMI、区域和异常排查路径,mirror_image.py也包含参数校验和错误反馈;但关键结论、版本和已知缺陷未由本地测试覆盖,且依赖外部目录、AWS CLI、Docker及其他技能,静态审查不能证明可运行,因此受静态上限限制并扣分。
触发条件、模型类别、容器选择和通用镜像回退边界较清楚,覆盖LLM、嵌入、重排、扩散和自定义代码;但未明确非适用输入、没有中文使用指导,核心信息依赖AWS/Hugging Face等海外服务,未说明中国大陆网络可达性,因此扣分。
SKILL.md结构清晰,包含决策表、工作流、配置、故障排查、参考文档、脚本和Apache-2.0许可;但缺少独立版本号、变更日志、明确维护责任人与更新流程,且引用的其他技能和部分外部资料未随本目标范围提供,因此扣分。
针对SageMaker镜像选择提供了可直接执行的分类规则、URI获取步骤、AMI映射和镜像镜像脚本,能完成核心判断;但没有完整部署示例、实际输出或静态可验证结果,用户仍需自行核对外部目录、区域和兼容性,故仅给中等偏上的静态分数。
文档引用AWS目录、区域页面、GitHub源码、SDK PR和安全策略,且仓库有生成文件校验CI;但没有覆盖该技能关键路径的专门测试、第三方执行记录或多源复核,当前结论主要依赖文档声明,因此扣分并受静态上限限制。
- 不要把文档中的“当前”“已验证”版本、镜像缺陷或AMI结论视为已在本次审查中复现;部署前必须重新核对AWS目录、目标区域、模型架构与任务兼容性。
- 使用mirror_image.py前应确认AWS和ECR最小权限、目标仓库范围、Docker凭据处理及创建仓库等外部副作用,并建立人工确认和回滚流程。
- 核心依赖AWS、ECR、Hugging Face Hub及公共网络;中国大陆网络或受限VPC环境可能无法访问目录、模型或公共ECR。
这个 Skill 能做什么,适合哪些场景?
该技能帮助代理为 Amazon SageMaker 模型部署选择正确的服务容器和当前镜像 URI。它要求优先使用 Hugging Face 精选的 DLC 镜像,并根据模型架构、任务、实例类型、区域和 CUDA 版本进行判断。技能覆盖 LLM、多模态模型、嵌入模型、重排器、分类器、扩散模型及自定义推理代码。它还提供 vLLM AMI、TEI CPU/GPU 变体、VPC 拉取、已知故障镜像和首次启动时间方面的部署检查。
读取 AWS Deep Learning Containers 官方目录中的镜像示例、标签、CUDA/Python 版本和平台信息;根据模型任务选择 huggingface-vllm、huggingface-vllm-omni、TEI、DJL Inference、HF Inference Toolkit、Hugging Face SGLang、AWS vLLM、BYOC 或 SageMaker JumpStart;根据区域替换 URI 中的区域占位符;检查 TEI 的 CPU/GPU 实例匹配和 vLLM 的 InferenceAmiVersion 要求;通过 config.json 区分基于 ForCausalLM 的生成式重排器与基于 ForSequenceClassification 的交叉编码器;必要时使用 curl、AWS CLI、ECR 或 mirror_image.py 获取或镜像容器;为部署脚本提供 image-uri 和相关环境变量建议。
- 准备把 Llama、Qwen 或 Mistral 等 Hugging Face 文本生成模型部署到 SageMaker 端点的工程师。
- 需要为多模态模型选择 Hugging Face vLLM-Omni 镜像的部署人员。
- 部署嵌入模型或 BERT 类交叉编码器重排器,并需要区分 TEI CPU/GPU 变体的团队。
- 部署 Qwen3-Reranker 等生成式重排器,需要避免错误选择 TEI 的团队。
- 在 VPC、特定 AWS 区域或 cu130 GPU 环境中排查镜像拉取和启动失败的工程师。
- 需要识别已知损坏的 Hugging Face GPU 推理镜像并选择 DJL Inference 或 BYOC 替代方案的团队。
这个 Skill 有哪些优点和局限?
- 明确规定兼容的 Hugging Face 镜像优先于通用 AWS vLLM、DJL-LMI 和 SGLang 镜像。
- 覆盖模型任务、区域、实例类型、CUDA/AMI 和 VPC 网络等常见部署陷阱。
- 特别区分 TEI 交叉编码器重排器与 vLLM 生成式重排器。
- 记录了 huggingface-pytorch-inference GPU 标签、TGI 和旧版 Hub 下载路径等已知问题。
- 强依赖 AWS 官方目录、区域可用性信息和当前镜像状态,内容会随 AWS 发布变化。
- 文档没有展示独立的测试套件或自动验证所有区域和镜像组合。
- 镜像选择之外的端点创建、生产默认值和 IAM 流程由其他技能负责。
- 镜像镜像流程需要 Docker、AWS CLI 和可用的 AWS/ECR 权限。
如何安装这个 Skill?
从仓库的 skills/ 目录复制或建立 skills/hf-cloud-serving-image-selection/ 的符号链接到 Codex 标准的 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。README 没有为这个单独技能提供专用安装命令。
如何使用这个 Skill?
在支持 Agent Skills 的编码代理中提出类似请求:"把 Qwen 模型部署到 SageMaker,请选择正确的服务镜像 URI,并检查区域、实例类型和 vLLM AMI 要求。" 在创建资源前,提供模型 ID、AWS 区域、实例类型和部署方式;技能会指导代理从 AWS DLC 目录读取 URI,而不是凭记忆硬编码。
这个 Skill 与同类方案有什么区别?
该技能明确将 Hugging Face vLLM 与 AWS vLLM、DJL Inference、SGLang、DJL-LMI 和 TGI 进行选择上的对比:只要 Hugging Face 镜像兼容,就必须优先使用;AWS vLLM 仅作为经过验证的不兼容、区域缺失或已知故障时的后备方案;TGI 不应使用。