自动化与运维 ✓ NVIDIA · 官方 jetsonvllmsglangdockerllm-servingvlm-servinghugging-face

Jetson LLM 服务部署技能

为 NVIDIA Jetson 配置并启动 vLLM 或 SGLang 的 LLM/VLM 服务。

FollowSkills 评估 · FSRS-2.0
不推荐
54/ 100 五分制 2.7 / 5
信任安全16 / 25 · 3.2/5

文档明确限制 sudo、Docker GPU、主机网络、0.0.0.0 暴露、HF_TOKEN 和停止服务等风险,并要求 MIG/服务变更需用户批准;但没有默认绑定本地地址、完整回滚方案或依赖镜像完整性校验,因此扣分。

可靠稳定8 / 20 · 2.0/5

运行路径、设备分支、启动命令和 OOM 调整建议较完整;但 vLLM 显存参数存在 0.75 与 0.85 不一致,依赖 latest 标签,缺少该技能自身的可执行测试和更充分的启动失败诊断,因此扣分。

适用触发10 / 15 · 3.3/5

目标用户、Jetson 型号分支、LLM/VLM 场景、触发条件和不适用的 benchmark handoff 写得清楚;但没有中文交互支持说明,也未处理中国大陆访问 Hugging Face、GHCR、NVIDIA 注册表的可达性,因此扣分。

规范维护9 / 15 · 3.0/5

信息结构、前置条件、步骤、限制、交接和许可证信息较完整,版本为 0.0.1 且有维护团队线索;但缺少 Examples 小节、规范作者邮箱、明确 changelog 和更新责任路径,且安装/依赖说明不够集中,因此扣分。

有效结果7 / 15 · 2.3/5

文档直接提供按平台选择的 docker run、vLLM/SGLang 参数、OpenAI 端点和 curl 验证步骤,能覆盖核心部署任务;静态审查无法验证实际可运行性、模型兼容性或结果质量,且仍需用户提供设备和模型信息,因此按静态上限给 7 分。

证据核验4 / 10 · 2.0/5

包含 Jetson AI Lab 与 NVIDIA-AI-IOT 参考来源,并有固定修订版本;但 benchmark 数据集不可用、没有该技能专属测试套件,报告中的评测数字无法独立复现,因此仅给有限证据分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 命令使用可变的 latest 镜像标签;生产或合规部署前应固定 digest 并记录镜像来源。
  • docker run 使用 --network host、--host 0.0.0.0 和端口 8000,可能将服务暴露到局域网;应由用户确认网络范围并配置访问控制。
  • HF_TOKEN 可能出现在 Docker inspect、进程元数据或日志中;应优先使用最小权限凭据、secret 或凭据文件。
  • 文档未验证中国大陆对 Hugging Face、GHCR、NVIDIA 注册表的访问可达性,部署前应准备镜像和模型缓存或合规镜像源。
  • vLLM 显存利用率示例存在 0.75 与 0.85 不一致,需根据目标设备和模型明确采用的值。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能为 NVIDIA Jetson 提供适配硬件代际的 vLLM 或 SGLang 部署配方。它区分 Thor、JetPack 7.2 及以上的 Orin,以及较旧 Orin 所需的容器路径,并生成 OpenAI 兼容服务的启动与验证步骤。技能覆盖 LLM 和 VLM,但不负责性能基准测试。适合已经具备 Jetson、Docker 和 GPU 运行时环境、希望快速暴露模型 API 的用户。

识别或要求确认 Jetson 的 Thor/Orin 世代,选择对应的 vLLM 或 SGLang 容器;指导设置 MAXN 电源模式、挂载 Hugging Face 缓存并按需传入 HF_TOKEN;提供包含模型仓库、端口 8000、上下文长度、GPU 内存利用率和张量并行参数的 docker run 与服务命令;将服务暴露为 http://<jetson-ip>:8000/v1,并用 curl http://localhost:8000/v1/models 验证;针对 OOM、MIG、显示/相机占用和已有 vllm 容器给出检查或处理建议。

  1. Jetson Thor 用户希望用 vLLM 托管一个 Hugging Face LLM,并让 Open WebUI 或应用通过 OpenAI 兼容接口访问。
  2. JetPack 7.2 及以上的 Orin 用户需要启动 upstream vLLM 服务。
  3. 较旧 Orin 用户需要使用 NVIDIA-AI-IOT 预构建 vLLM 镜像部署模型。
  4. Jetson 用户希望运行 VLM,并需要知道如何使用与 LLM 相同的 vLLM 流程。
  5. 用户需要 RAG、工具调用、结构化生成或 SGLang 特定调度,并使用 Thor。
  6. 服务启动时 OOM,用户需要降低 GPU 内存利用率或转交内存调优技能。

这个 Skill 有哪些优点和局限?

优点
  • 明确区分 Thor、不同 Orin JetPack 版本和对应容器路径。
  • 同时覆盖 vLLM、Thor 上的 NVIDIA SGLang、LLM 与 VLM。
  • 提供端点、验证命令、MAXN 设置、量化偏好和常见故障检查。
  • 包含 HF_TOKEN 暴露风险、MIG 和 GPU 设备占用等运维注意事项。
局限
  • 依赖 Jetson 主机、Docker NVIDIA 运行时和实际 GPU 访问权限。
  • 不执行部署基准测试,也不提供性能结果。
  • 模型容量、上下文长度、并发数和量化适配仍需按实际设备验证。
  • 示例使用 latest 等可变标签;合规或发布部署需要自行固定 digest。
  • SKILL.md 未记录独立测试套件或具体设备覆盖结果。

如何安装这个 Skill?

从 NVIDIA/skills 集合安装该技能:npx skills add nvidia/skills --skill jetson-llm-serve --yes。README 说明也可以用 --agent codex、--agent claude-code 等参数指定客户端;技能安装后,在代理下次加载技能并遇到相关任务时可用。

如何使用这个 Skill?

安装后可用类似“在我的 Jetson Thor 上用 vLLM 部署 Hugging Face 模型 <hf-repo-id>,提供 OpenAI 兼容 API”的提示触发。技能会根据 Jetson 世代选择运行时,并提供 docker run、vllm serve 或 SGLang 启动命令、http://<jetson-ip>:8000/v1 端点和 curl 验证步骤。实际部署前需要在 Jetson 主机或具备 Jetson GPU Docker 访问权限的 shell 中执行命令;仅询问配方时不应启动容器。

这个 Skill 与同类方案有什么区别?

vLLM 适合普通的高吞吐 OpenAI 兼容服务;当用户需要 RAG、工具调用、结构化生成或 SGLang 特定调度时,技能建议在 Thor 上使用 NVIDIA SGLang 26.01。较旧 Orin 使用 NVIDIA-AI-IOT 预构建 vLLM 镜像,而 JetPack 7.2 / L4T r39+ 的 Orin 可使用 upstream vLLM。

常见问题

这个技能是否收费?
提供的资料没有说明技能或相关容器的价格,不能据此判断费用。
必须提供 HF_TOKEN 吗?
只有 gated 或 private Hugging Face 模型需要 HF_TOKEN;公开且无需 Hub 认证的模型应省略该环境变量。
服务启动时内存不足怎么办?
先将 --gpu-memory-utilization 降低 0.05 后重新启动,或转交 jetson-inference-mem-tune 获取面向工作负载的建议。
它能直接部署 VLM 吗?
可以。VLM 使用相同的 Jetson 容器和 vllm serve 流程,只需替换为视觉语言模型检查点。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

Jetson 推理内存调优

根据 Jetson 设备内存和工作负载选择推理服务栈并生成启动参数。

自动化与运维 ✓ NVIDIA · 官方

Jetson 软件包与环境助手

为 Jetson 选择匹配架构的容器与 GPU 软件包。

自动化与运维 ✓ NVIDIA · 官方

Jetson vLLM 推测解码调优

为 Jetson vLLM 服务配置推测解码,降低单流生成延迟。

自动化与运维 ✓ NVIDIA · 官方

Jetson 大模型基准测试

在 Jetson 上统一测量并比较多种大模型运行时性能。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析报告

为单个视频片段或事件时间范围生成结构化的视频分析报告。

开发与工程 ✓ NVIDIA · 官方

NV-Reason-CXR 胸部X光推理测试技能

为胸部X光模型执行可复现的命令形状与在线推理冒烟测试。

自动化与运维 ✓ NVIDIA · 官方

NeMo-RL Brev 运行规范

帮助 NeMo-RL 代理在 Brev 上安全管理实验存储、缓存、日志与认证。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

开发与工程 ✓ NVIDIA · 官方

Jetson 目标平台切换器

在已有 Jetson 平台配置之间切换当前活动目标。

开发与工程 ✓ NVIDIA · 官方

Jetson BSP 信息检查

在刷写前快速核验 Jetson BSP 版本、板卡配置与 rootfs 状态。

开发与工程 ✓ NVIDIA · 官方

Jetson BSP 源码构建

根据 Jetson BSP 源码变更重建设备树、内核和模块,并生成可部署清单。

自动化与运维 ✓ NVIDIA · 官方

Jetson 设备信息快照

在运行中的 Jetson 上快速采集软件栈、内核、系统版本和电源模式。

开发与工程 ✓ NVIDIA · 官方

Jetson PCIe 控制器定制

为 Jetson Thor 或 Orin 定制 PCIe 控制器状态、通道数和链路速率。

开发与工程 ✓ NVIDIA · 官方

Jetson 目标平台初始化

为 Jetson 开发套件或定制载板创建目标平台配置并更新活动指针。

开发与工程 ✓ NVIDIA · 官方

Jetson 时钟定制

在刷写 Jetson 镜像前,锁定或限制 CPU、GPU 与 EMC 的时钟行为。

自动化与运维 ✓ NVIDIA · 官方

Jetson 健康快照

以只读方式汇总 Jetson 的硬件、资源与服务状态。

开发与工程 ✓ NVIDIA · 官方

Jetson BSP 镜像刷写

将已提升的 Jetson BSP 镜像安全刷入处于 RCM 模式的设备。

开发与工程 ✓ NVIDIA · 官方

Jetson BSP 快速启动

用一次问卷选择 Jetson BSP 定制路径并衔接后续设置技能。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

相关 Skills