Jetson LLM 服务部署技能
为 NVIDIA Jetson 配置并启动 vLLM 或 SGLang 的 LLM/VLM 服务。
文档明确限制 sudo、Docker GPU、主机网络、0.0.0.0 暴露、HF_TOKEN 和停止服务等风险,并要求 MIG/服务变更需用户批准;但没有默认绑定本地地址、完整回滚方案或依赖镜像完整性校验,因此扣分。
运行路径、设备分支、启动命令和 OOM 调整建议较完整;但 vLLM 显存参数存在 0.75 与 0.85 不一致,依赖 latest 标签,缺少该技能自身的可执行测试和更充分的启动失败诊断,因此扣分。
目标用户、Jetson 型号分支、LLM/VLM 场景、触发条件和不适用的 benchmark handoff 写得清楚;但没有中文交互支持说明,也未处理中国大陆访问 Hugging Face、GHCR、NVIDIA 注册表的可达性,因此扣分。
信息结构、前置条件、步骤、限制、交接和许可证信息较完整,版本为 0.0.1 且有维护团队线索;但缺少 Examples 小节、规范作者邮箱、明确 changelog 和更新责任路径,且安装/依赖说明不够集中,因此扣分。
文档直接提供按平台选择的 docker run、vLLM/SGLang 参数、OpenAI 端点和 curl 验证步骤,能覆盖核心部署任务;静态审查无法验证实际可运行性、模型兼容性或结果质量,且仍需用户提供设备和模型信息,因此按静态上限给 7 分。
包含 Jetson AI Lab 与 NVIDIA-AI-IOT 参考来源,并有固定修订版本;但 benchmark 数据集不可用、没有该技能专属测试套件,报告中的评测数字无法独立复现,因此仅给有限证据分。
- 命令使用可变的 latest 镜像标签;生产或合规部署前应固定 digest 并记录镜像来源。
- docker run 使用 --network host、--host 0.0.0.0 和端口 8000,可能将服务暴露到局域网;应由用户确认网络范围并配置访问控制。
- HF_TOKEN 可能出现在 Docker inspect、进程元数据或日志中;应优先使用最小权限凭据、secret 或凭据文件。
- 文档未验证中国大陆对 Hugging Face、GHCR、NVIDIA 注册表的访问可达性,部署前应准备镜像和模型缓存或合规镜像源。
- vLLM 显存利用率示例存在 0.75 与 0.85 不一致,需根据目标设备和模型明确采用的值。
这个 Skill 能做什么,适合哪些场景?
该技能为 NVIDIA Jetson 提供适配硬件代际的 vLLM 或 SGLang 部署配方。它区分 Thor、JetPack 7.2 及以上的 Orin,以及较旧 Orin 所需的容器路径,并生成 OpenAI 兼容服务的启动与验证步骤。技能覆盖 LLM 和 VLM,但不负责性能基准测试。适合已经具备 Jetson、Docker 和 GPU 运行时环境、希望快速暴露模型 API 的用户。
识别或要求确认 Jetson 的 Thor/Orin 世代,选择对应的 vLLM 或 SGLang 容器;指导设置 MAXN 电源模式、挂载 Hugging Face 缓存并按需传入 HF_TOKEN;提供包含模型仓库、端口 8000、上下文长度、GPU 内存利用率和张量并行参数的 docker run 与服务命令;将服务暴露为 http://<jetson-ip>:8000/v1,并用 curl http://localhost:8000/v1/models 验证;针对 OOM、MIG、显示/相机占用和已有 vllm 容器给出检查或处理建议。
- Jetson Thor 用户希望用 vLLM 托管一个 Hugging Face LLM,并让 Open WebUI 或应用通过 OpenAI 兼容接口访问。
- JetPack 7.2 及以上的 Orin 用户需要启动 upstream vLLM 服务。
- 较旧 Orin 用户需要使用 NVIDIA-AI-IOT 预构建 vLLM 镜像部署模型。
- Jetson 用户希望运行 VLM,并需要知道如何使用与 LLM 相同的 vLLM 流程。
- 用户需要 RAG、工具调用、结构化生成或 SGLang 特定调度,并使用 Thor。
- 服务启动时 OOM,用户需要降低 GPU 内存利用率或转交内存调优技能。
这个 Skill 有哪些优点和局限?
- 明确区分 Thor、不同 Orin JetPack 版本和对应容器路径。
- 同时覆盖 vLLM、Thor 上的 NVIDIA SGLang、LLM 与 VLM。
- 提供端点、验证命令、MAXN 设置、量化偏好和常见故障检查。
- 包含 HF_TOKEN 暴露风险、MIG 和 GPU 设备占用等运维注意事项。
- 依赖 Jetson 主机、Docker NVIDIA 运行时和实际 GPU 访问权限。
- 不执行部署基准测试,也不提供性能结果。
- 模型容量、上下文长度、并发数和量化适配仍需按实际设备验证。
- 示例使用 latest 等可变标签;合规或发布部署需要自行固定 digest。
- SKILL.md 未记录独立测试套件或具体设备覆盖结果。
如何安装这个 Skill?
从 NVIDIA/skills 集合安装该技能:npx skills add nvidia/skills --skill jetson-llm-serve --yes。README 说明也可以用 --agent codex、--agent claude-code 等参数指定客户端;技能安装后,在代理下次加载技能并遇到相关任务时可用。
如何使用这个 Skill?
安装后可用类似“在我的 Jetson Thor 上用 vLLM 部署 Hugging Face 模型 <hf-repo-id>,提供 OpenAI 兼容 API”的提示触发。技能会根据 Jetson 世代选择运行时,并提供 docker run、vllm serve 或 SGLang 启动命令、http://<jetson-ip>:8000/v1 端点和 curl 验证步骤。实际部署前需要在 Jetson 主机或具备 Jetson GPU Docker 访问权限的 shell 中执行命令;仅询问配方时不应启动容器。
这个 Skill 与同类方案有什么区别?
vLLM 适合普通的高吞吐 OpenAI 兼容服务;当用户需要 RAG、工具调用、结构化生成或 SGLang 特定调度时,技能建议在 Thor 上使用 NVIDIA SGLang 26.01。较旧 Orin 使用 NVIDIA-AI-IOT 预构建 vLLM 镜像,而 JetPack 7.2 / L4T r39+ 的 Orin 可使用 upstream vLLM。