自动化与运维 amazon-sagemakerecrvllmtext-embeddings-inferencedjl-inferencecuda-compatibility

SageMaker 服务镜像选择器

为 Hugging Face 模型选择兼容的 SageMaker 服务容器,并获取当前区域的镜像 URI。

FollowSkills 评估 · FSRS-2.0
不推荐
47/ 100 五分制 2.4 / 5
信任安全11 / 25 · 2.2/5

技能明确要求从AWS官方DLC目录读取URI,并提示令牌、VPC、区域和镜像来源;但部署与镜像脚本会创建ECR仓库、登录公共/私有注册表、拉取并推送镜像,未要求用户确认、未提供回滚或最小权限说明,也未充分说明敏感令牌的数据流,因此扣分。

可靠稳定8 / 20 · 2.0/5

文档提供了较完整的决策表、环境变量、AMI、区域和异常排查路径,mirror_image.py也包含参数校验和错误反馈;但关键结论、版本和已知缺陷未由本地测试覆盖,且依赖外部目录、AWS CLI、Docker及其他技能,静态审查不能证明可运行,因此受静态上限限制并扣分。

适用触发10 / 15 · 3.3/5

触发条件、模型类别、容器选择和通用镜像回退边界较清楚,覆盖LLM、嵌入、重排、扩散和自定义代码;但未明确非适用输入、没有中文使用指导,核心信息依赖AWS/Hugging Face等海外服务,未说明中国大陆网络可达性,因此扣分。

规范维护8 / 15 · 2.7/5

SKILL.md结构清晰,包含决策表、工作流、配置、故障排查、参考文档、脚本和Apache-2.0许可;但缺少独立版本号、变更日志、明确维护责任人与更新流程,且引用的其他技能和部分外部资料未随本目标范围提供,因此扣分。

有效结果6 / 15 · 2.0/5

针对SageMaker镜像选择提供了可直接执行的分类规则、URI获取步骤、AMI映射和镜像镜像脚本,能完成核心判断;但没有完整部署示例、实际输出或静态可验证结果,用户仍需自行核对外部目录、区域和兼容性,故仅给中等偏上的静态分数。

证据核验4 / 10 · 2.0/5

文档引用AWS目录、区域页面、GitHub源码、SDK PR和安全策略,且仓库有生成文件校验CI;但没有覆盖该技能关键路径的专门测试、第三方执行记录或多源复核,当前结论主要依赖文档声明,因此扣分并受静态上限限制。

证据充分度: 评估于 2026年7月20日 审查版本 86cdeee824b7
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要把文档中的“当前”“已验证”版本、镜像缺陷或AMI结论视为已在本次审查中复现;部署前必须重新核对AWS目录、目标区域、模型架构与任务兼容性。
  • 使用mirror_image.py前应确认AWS和ECR最小权限、目标仓库范围、Docker凭据处理及创建仓库等外部副作用,并建立人工确认和回滚流程。
  • 核心依赖AWS、ECR、Hugging Face Hub及公共网络;中国大陆网络或受限VPC环境可能无法访问目录、模型或公共ECR。
评估证据 [1][2][3][4][5][6][7]
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能帮助代理为 Amazon SageMaker 模型部署选择正确的服务容器和当前镜像 URI。它要求优先使用 Hugging Face 精选的 DLC 镜像,并根据模型架构、任务、实例类型、区域和 CUDA 版本进行判断。技能覆盖 LLM、多模态模型、嵌入模型、重排器、分类器、扩散模型及自定义推理代码。它还提供 vLLM AMI、TEI CPU/GPU 变体、VPC 拉取、已知故障镜像和首次启动时间方面的部署检查。

读取 AWS Deep Learning Containers 官方目录中的镜像示例、标签、CUDA/Python 版本和平台信息;根据模型任务选择 huggingface-vllm、huggingface-vllm-omni、TEI、DJL Inference、HF Inference Toolkit、Hugging Face SGLang、AWS vLLM、BYOC 或 SageMaker JumpStart;根据区域替换 URI 中的区域占位符;检查 TEI 的 CPU/GPU 实例匹配和 vLLM 的 InferenceAmiVersion 要求;通过 config.json 区分基于 ForCausalLM 的生成式重排器与基于 ForSequenceClassification 的交叉编码器;必要时使用 curl、AWS CLI、ECR 或 mirror_image.py 获取或镜像容器;为部署脚本提供 image-uri 和相关环境变量建议。

  1. 准备把 Llama、Qwen 或 Mistral 等 Hugging Face 文本生成模型部署到 SageMaker 端点的工程师。
  2. 需要为多模态模型选择 Hugging Face vLLM-Omni 镜像的部署人员。
  3. 部署嵌入模型或 BERT 类交叉编码器重排器,并需要区分 TEI CPU/GPU 变体的团队。
  4. 部署 Qwen3-Reranker 等生成式重排器,需要避免错误选择 TEI 的团队。
  5. 在 VPC、特定 AWS 区域或 cu130 GPU 环境中排查镜像拉取和启动失败的工程师。
  6. 需要识别已知损坏的 Hugging Face GPU 推理镜像并选择 DJL Inference 或 BYOC 替代方案的团队。

这个 Skill 有哪些优点和局限?

优点
  • 明确规定兼容的 Hugging Face 镜像优先于通用 AWS vLLM、DJL-LMI 和 SGLang 镜像。
  • 覆盖模型任务、区域、实例类型、CUDA/AMI 和 VPC 网络等常见部署陷阱。
  • 特别区分 TEI 交叉编码器重排器与 vLLM 生成式重排器。
  • 记录了 huggingface-pytorch-inference GPU 标签、TGI 和旧版 Hub 下载路径等已知问题。
局限
  • 强依赖 AWS 官方目录、区域可用性信息和当前镜像状态,内容会随 AWS 发布变化。
  • 文档没有展示独立的测试套件或自动验证所有区域和镜像组合。
  • 镜像选择之外的端点创建、生产默认值和 IAM 流程由其他技能负责。
  • 镜像镜像流程需要 Docker、AWS CLI 和可用的 AWS/ECR 权限。

如何安装这个 Skill?

从仓库的 skills/ 目录复制或建立 skills/hf-cloud-serving-image-selection/ 的符号链接到 Codex 标准的 .agents/skills 位置,例如 $REPO_ROOT/.agents/skills 或 $HOME/.agents/skills。README 没有为这个单独技能提供专用安装命令。

如何使用这个 Skill?

在支持 Agent Skills 的编码代理中提出类似请求:"把 Qwen 模型部署到 SageMaker,请选择正确的服务镜像 URI,并检查区域、实例类型和 vLLM AMI 要求。" 在创建资源前,提供模型 ID、AWS 区域、实例类型和部署方式;技能会指导代理从 AWS DLC 目录读取 URI,而不是凭记忆硬编码。

这个 Skill 与同类方案有什么区别?

该技能明确将 Hugging Face vLLM 与 AWS vLLM、DJL Inference、SGLang、DJL-LMI 和 TGI 进行选择上的对比:只要 Hugging Face 镜像兼容,就必须优先使用;AWS vLLM 仅作为经过验证的不兼容、区域缺失或已知故障时的后备方案;TGI 不应使用。

常见问题

这个技能会自动部署 SageMaker 端点吗?
不会。它负责选择服务容器、读取或推导镜像 URI,并给出配置检查;端点创建由部署脚本或其他生产部署技能完成。
为什么不能直接选择版本号更新的 AWS vLLM 镜像?
技能要求先满足模型兼容性。通用镜像版本更新本身不是使用它的理由;只要兼容的 Hugging Face 镜像存在,就必须优先使用。
TEI 能服务所有重排器吗?
不能。BERT 类 ForSequenceClassification 交叉编码器使用 TEI;Qwen3-Reranker 等 ForCausalLM 生成式重排器应使用 Hugging Face vLLM。
使用 cu130 或更高版本的 vLLM 镜像需要什么?
需要在 ProductionVariant 设置 InferenceAmiVersion=al2-ami-sagemaker-inference-gpu-3-1,否则容器可能在启动时失败。

同仓库的其他 Skills

均来自 huggingface/skills

自动化与运维

SageMaker 模型部署规划器

为不同模型和流量需求选择合适的 AWS SageMaker 部署路径。

自动化与运维

SageMaker 生产部署默认配置

为 SageMaker 实时或异步端点自动配置弹性伸缩、CloudWatch 告警和资源标签。

数据与分析

Hugging Face 本地模型评测

在本地硬件上为 Hugging Face Hub 模型运行可控的 inspect-ai 或 lighteval 评测。

开发与工程

Hugging Face ZeroGPU 开发指南

帮助你构建可靠的 Gradio ZeroGPU AI 演示与 GPU 工作负载。

自动化与运维

AWS 云账户上下文发现

在 AWS 操作前准确识别本地配置、账户与身份。

自动化与运维

SageMaker Python 环境管家

为 SageMaker 与 AWS 任务创建隔离且版本正确的 Python 环境。

数据与分析

Hugging Face 数据集探索助手

通过 Dataset Viewer API 探索、检索和提取 Hugging Face 数据集。

开发与工程

Hugging Face 本地模型运行器

帮助你从 Hugging Face 选择合适的 GGUF 量化模型,并用 llama.cpp 在本机运行。

自动化与运维

SageMaker 执行角色预检

在 SageMaker 部署或训练前发现并验证可用的 IAM 执行角色。

开发与工程

LoRA Space Demo Builder

为 Hugging Face LoRA 自动设计并发布定制化 Gradio 演示 Space。

开发与工程

Hugging Face Spaces 构建器

帮助智能体创建、部署和维护 Hugging Face Spaces 应用。

开发与工程

Hugging Face 论文研究助手

读取 AI 论文并提取 Hugging Face 论文页的结构化元数据。

数据与分析

Hugging Face LLM 训练器

在 Hugging Face 云端 GPU 上训练、微调并保存模型。

数据与分析

TRL 大模型训练助手

用 TRL 命令行完成语言模型的监督微调、偏好对齐与强化学习训练。

数据与分析

Sentence Transformers 训练助手

为检索、相似度与稀疏搜索训练 Sentence Transformers 模型。

数据与分析

Transformers.js 浏览器与 Node.js 推理技能

在 JavaScript 应用中直接运行 Hugging Face 模型。

数据与分析

Hugging Face 模型内存估算器

在不下载权重的情况下估算模型推理所需内存。

数据与分析

Trackio 实验追踪

记录、监控并分析机器学习训练实验,让指标和诊断告警可供自动化工作流使用。

数据与分析

Hugging Face 视觉模型训练助手

在 Hugging Face Jobs 云 GPU 上训练检测、分类与分割视觉模型,并将结果保存到 Hub。

开发与工程

Hugging Face Hub CLI 技能

让智能体通过 hf 命令管理 Hugging Face Hub 上的模型、数据集、空间、作业与基础设施。

相关 Skills