开发与工程 ✓ NVIDIA · 官方 nvidia-jetsoninference-servingmemory-tuningvllmsglangllama-cpptensorrt-edge-llm

Jetson 推理内存调优

根据 Jetson 设备内存和工作负载选择推理服务栈并生成启动参数。

FollowSkills 评估 · FSRS-2.0
不推荐
50/ 100 五分制 2.5 / 5
信任安全17 / 25 · 3.4/5

技能明确声明只读、不启动或重启服务,并要求用户先审计、再确认执行;权限和数据流仍不够透明:示例使用 host 网络、0.0.0.0、HF_TOKEN、主机缓存及外部容器仓库,未说明令牌最小权限、镜像固定、网络限制或敏感缓存处理。无破坏性默认值且易于回滚,但没有逐步确认机制。NVIDIA 来源可追溯,但不能替代安全证据。扣分原因是外部依赖、凭据与网络暴露控制不完整。

可靠稳定7 / 20 · 1.8/5

SKILL.md、recommend.py 和错误码基本一致,输入、输出及空 launch_flags 行为有说明;但没有覆盖关键路径的提交测试,BENCHMARK.md 的数据集不可用且不能作为静态可复现实验证据。脚本对合法但非对象 JSON、部分异常字段和边界 target_mb 的处理不完整,且若干运行时/版本假设未在本地验证。按静态校准限制不超过10分,因异常输入与失败反馈不足扣分。

适用触发9 / 15 · 3.0/5

目标设备、工作负载、审计快照、运行时和非适用范围写得较清楚,也明确排除量化配方选择和服务器启停;但“任何 Jetson”与实际版本/运行时支持条件存在张力,触发排除条件和功能边界仍需人工判断。没有中文交互或中国大陆网络可达性说明,且核心镜像依赖 ghcr.io、nvcr.io、HF 等海外服务,故扣分。

规范维护9 / 15 · 3.0/5

文档结构清晰,包含前置条件、脚本参数、流程、限制、错误处理、输出契约、运行时表、版本号和评估报告;但缺少推荐的 Examples 章节,作者格式不符合报告中的校验要求,维护责任和更新路径不够具体,许可证在 frontmatter、skill-card 和仓库级元数据之间存在 Apache/CC-BY/NOASSERTION 表述差异。扣分来自治理和安装排障信息不完整。

有效结果5 / 15 · 1.7/5

脚本可直接从审计 JSON 生成运行时、理由、launch_flags、替代方案和备注,能够覆盖主要内存调优任务;但 flags 是按 SKU 默认值和粗略内存比例估算,未验证模型、KV cache、量化、吞吐或实际 OOM 结果。BENCHMARK.md 报告的总体 effectiveness 仅约49%,且数据集不可复核。按静态校准限制不超过7分,因结果正确性和直接可用性仍需现场测试扣分。

证据核验3 / 10 · 1.5/5

源代码、错误码、输出契约和有限的 eval assertions 提供了可审计材料;但没有针对该技能关键路径的提交测试,评估仅单次尝试,原始数据集不可用,且报告不能独立重现。静态审阅未执行脚本,也没有多来源交叉验证,因此仅给有限证据分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要把脚本生成的 SKU 默认 flags 当作已验证的生产配置;应在目标 Jetson 上用新审计、模型实际参数和基准测试复核。
  • 执行示例前应审查 HF_TOKEN、模型缓存、host 网络、0.0.0.0 监听地址以及未固定的容器镜像标签。
  • 许可证和作者元数据需要统一;评估报告缺少可复核数据集,不能把其结果视为独立验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA Jetson 上的 LLM/VLM 服务部署。它读取 jetson-memory-audit 生成的设备内存快照,并在 vLLM、SGLang、llama.cpp 和 TensorRT Edge-LLM 之间提出运行时建议。技能会生成与内存相关的启动参数,帮助用户降低 OOM 风险或切换到更省内存的服务栈。它只输出建议,不会启动、停止或重启模型服务。

要求先运行 jetson-memory-audit/scripts/audit.sh 获取 JSON 快照,再运行 scripts/recommend.py,根据 Jetson SKU、变体、工作负载和可选的目标可用内存生成运行时、理由、launch_flags、替代方案和备注。它覆盖 llm-server、vlm-server、embedding 和 rag 工作负载,并指出各运行时可高效服务的精度下限。

  1. 在 Orin Nano 8 GB 上运行 7B 模型的用户,需要选择更合适的服务栈。
  2. vLLM 发生 OOM 的用户,需要获得 gpu-memory-utilization 和 max-model-len 等具体参数。
  3. 希望在相同模型下减少内存占用、从 vLLM 切换到 llama.cpp 的用户。
  4. 运行 jetson-memory-audit 后发现模型服务器是主要 NvMap 或 PSS 内存消费者的用户。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖四种 Jetson LLM/VLM 推理运行时。
  • 输出具体的运行时启动参数,而非仅给出概念性建议。
  • 针对不同 Jetson 家族提供精度和安装路径指导。
  • 明确列出审计数据过期、模型 KV cache 和量化行为带来的不确定性。
局限
  • 必须先获得有效的 jetson-memory-audit JSON 快照。
  • 推荐结果依赖 SKU 默认值和审计总量,仍需模型级基准测试。
  • 不包含量化配方选择,也不执行服务器启动、停止或重启。
  • 提供的材料未包含脚本实现、测试套件或实际平台测试结果。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装指定技能:npx skills add nvidia/skills --skill jetson-inference-mem-tune --yes。README 未说明该技能的独立包或其他安装方式。

如何使用这个 Skill?

先在目标 Jetson 上运行 jetson-memory-audit/scripts/audit.sh,生成当前内存快照;然后从仓库根目录运行 python3 scripts/recommend.py --audit /tmp/audit.json --runtime auto --workload llm-server,必要时加入 --target-mb 或指定运行时。根据返回 JSON 中的 launch_flags 启动服务,之后重新运行审计验证。技能本身不会执行服务启停。

这个 Skill 与同类方案有什么区别?

该技能明确比较并选择 vLLM、SGLang、llama.cpp 和 TensorRT Edge-LLM:llama.cpp 面向最紧张的内存预算,vLLM 面向高吞吐连续批处理,SGLang 面向可编程工作流,TensorRT Edge-LLM 面向 NVIDIA 调优的生产服务。

常见问题

它会自动重启 OOM 的模型服务吗?
不会。技能是只读的,只输出运行时和启动参数建议,服务启停由用户或外部编排代理负责。
没有审计 JSON 时能否直接获得可靠参数?
不能。缺少或无法解析有效内存字段时,脚本应要求用户重新运行 jetson-memory-audit。
它是否负责选择量化方案?
不负责完整的量化配方选择;它只指出运行时可高效服务的精度下限,并提供运行时相关的量化方向。
推荐结果是否保证模型一定不 OOM?
不保证。KV cache、量化和 tokenizer 行为仍可能改变内存需求,必须通过重新审计和基准测试确认。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

Jetson LLM 服务部署技能

为 NVIDIA Jetson 配置并启动 vLLM 或 SGLang 的 LLM/VLM 服务。

自动化与运维 ✓ NVIDIA · 官方

Jetson 大模型基准测试

在 Jetson 上统一测量并比较多种大模型运行时性能。

自动化与运维 ✓ NVIDIA · 官方

Jetson 软件包与环境助手

为 Jetson 选择匹配架构的容器与 GPU 软件包。

自动化与运维 ✓ NVIDIA · 官方

Jetson vLLM 推测解码调优

为 Jetson vLLM 服务配置推测解码,降低单流生成延迟。

开发与工程 ✓ NVIDIA · 官方

DeepStream SOP 合规推理服务

帮助构建和调试基于 GPU 的工业视频 SOP 顺序与合规检测服务。

自动化与运维 ✓ NVIDIA · 官方

Jetson 健康快照

以只读方式汇总 Jetson 的硬件、资源与服务状态。

数据与分析 ✓ NVIDIA · 官方

Nemotron Speech ASR 定制编排

为特定领域或语言的语音识别改进选择并编排成本最低的适配路径。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

Jetson 无头模式内存优化

通过安全、可回滚的系统服务调整,为无桌面 Jetson 设备释放内存。

自动化与运维 ✓ NVIDIA · 官方

RAG 性能基准测试

用单一 YAML 配置分析已部署 NVIDIA RAG Blueprint 服务的性能瓶颈。

开发与工程 ✓ NVIDIA · 官方

DOCA DMA 编程助手

指导在 BlueField 或 ConnectX 上进行 DOCA DMA 内存拷贝开发。

自动化与运维 ✓ NVIDIA · 官方

Jetson nvpmodel 电源模式定制

在 Jetson BSP 中安全调整 nvpmodel 电源模式、频率上限和启动默认值。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

开发与工程 ✓ NVIDIA · 官方

DeepStream 管道构建器

通过交互式需求收集,为 NVIDIA DeepStream 生成并验证可运行的 GStreamer 推理管道。

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 互联就绪检查

在信任 Dynamo 分离式服务的性能数据前,验证 RDMA、NVLink 与 NIXL 传输链路是否就绪。

开发与工程 ✓ NVIDIA · 官方

Holoscan Conda 安装助手

在 Linux x86_64 的 CUDA 13 环境中,通过 Conda 安装并验证 Holoscan SDK。

开发与工程 ✓ NVIDIA · 官方

Holoscan Ubuntu 原生安装助手

在 Ubuntu 上通过 NVIDIA apt 仓库安装并验证 Holoscan SDK C++ 环境。

自动化与运维 ✓ NVIDIA · 官方

Jetson 内存审计

用设备实时数据审计 Jetson 内存占用,并验证内存回收是否真正生效。

开发与工程 ✓ NVIDIA · 官方

Jetson 内存优化

为无显示或无摄像头的 Jetson 部署回收未使用的 DRAM。

相关 Skills