Jetson 推理内存调优
根据 Jetson 设备内存和工作负载选择推理服务栈并生成启动参数。
技能明确声明只读、不启动或重启服务,并要求用户先审计、再确认执行;权限和数据流仍不够透明:示例使用 host 网络、0.0.0.0、HF_TOKEN、主机缓存及外部容器仓库,未说明令牌最小权限、镜像固定、网络限制或敏感缓存处理。无破坏性默认值且易于回滚,但没有逐步确认机制。NVIDIA 来源可追溯,但不能替代安全证据。扣分原因是外部依赖、凭据与网络暴露控制不完整。
SKILL.md、recommend.py 和错误码基本一致,输入、输出及空 launch_flags 行为有说明;但没有覆盖关键路径的提交测试,BENCHMARK.md 的数据集不可用且不能作为静态可复现实验证据。脚本对合法但非对象 JSON、部分异常字段和边界 target_mb 的处理不完整,且若干运行时/版本假设未在本地验证。按静态校准限制不超过10分,因异常输入与失败反馈不足扣分。
目标设备、工作负载、审计快照、运行时和非适用范围写得较清楚,也明确排除量化配方选择和服务器启停;但“任何 Jetson”与实际版本/运行时支持条件存在张力,触发排除条件和功能边界仍需人工判断。没有中文交互或中国大陆网络可达性说明,且核心镜像依赖 ghcr.io、nvcr.io、HF 等海外服务,故扣分。
文档结构清晰,包含前置条件、脚本参数、流程、限制、错误处理、输出契约、运行时表、版本号和评估报告;但缺少推荐的 Examples 章节,作者格式不符合报告中的校验要求,维护责任和更新路径不够具体,许可证在 frontmatter、skill-card 和仓库级元数据之间存在 Apache/CC-BY/NOASSERTION 表述差异。扣分来自治理和安装排障信息不完整。
脚本可直接从审计 JSON 生成运行时、理由、launch_flags、替代方案和备注,能够覆盖主要内存调优任务;但 flags 是按 SKU 默认值和粗略内存比例估算,未验证模型、KV cache、量化、吞吐或实际 OOM 结果。BENCHMARK.md 报告的总体 effectiveness 仅约49%,且数据集不可复核。按静态校准限制不超过7分,因结果正确性和直接可用性仍需现场测试扣分。
源代码、错误码、输出契约和有限的 eval assertions 提供了可审计材料;但没有针对该技能关键路径的提交测试,评估仅单次尝试,原始数据集不可用,且报告不能独立重现。静态审阅未执行脚本,也没有多来源交叉验证,因此仅给有限证据分。
- 不要把脚本生成的 SKU 默认 flags 当作已验证的生产配置;应在目标 Jetson 上用新审计、模型实际参数和基准测试复核。
- 执行示例前应审查 HF_TOKEN、模型缓存、host 网络、0.0.0.0 监听地址以及未固定的容器镜像标签。
- 许可证和作者元数据需要统一;评估报告缺少可复核数据集,不能把其结果视为独立验证。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA Jetson 上的 LLM/VLM 服务部署。它读取 jetson-memory-audit 生成的设备内存快照,并在 vLLM、SGLang、llama.cpp 和 TensorRT Edge-LLM 之间提出运行时建议。技能会生成与内存相关的启动参数,帮助用户降低 OOM 风险或切换到更省内存的服务栈。它只输出建议,不会启动、停止或重启模型服务。
要求先运行 jetson-memory-audit/scripts/audit.sh 获取 JSON 快照,再运行 scripts/recommend.py,根据 Jetson SKU、变体、工作负载和可选的目标可用内存生成运行时、理由、launch_flags、替代方案和备注。它覆盖 llm-server、vlm-server、embedding 和 rag 工作负载,并指出各运行时可高效服务的精度下限。
- 在 Orin Nano 8 GB 上运行 7B 模型的用户,需要选择更合适的服务栈。
- vLLM 发生 OOM 的用户,需要获得 gpu-memory-utilization 和 max-model-len 等具体参数。
- 希望在相同模型下减少内存占用、从 vLLM 切换到 llama.cpp 的用户。
- 运行 jetson-memory-audit 后发现模型服务器是主要 NvMap 或 PSS 内存消费者的用户。
这个 Skill 有哪些优点和局限?
- 覆盖四种 Jetson LLM/VLM 推理运行时。
- 输出具体的运行时启动参数,而非仅给出概念性建议。
- 针对不同 Jetson 家族提供精度和安装路径指导。
- 明确列出审计数据过期、模型 KV cache 和量化行为带来的不确定性。
- 必须先获得有效的 jetson-memory-audit JSON 快照。
- 推荐结果依赖 SKU 默认值和审计总量,仍需模型级基准测试。
- 不包含量化配方选择,也不执行服务器启动、停止或重启。
- 提供的材料未包含脚本实现、测试套件或实际平台测试结果。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:npx skills add nvidia/skills --skill jetson-inference-mem-tune --yes。README 未说明该技能的独立包或其他安装方式。
如何使用这个 Skill?
先在目标 Jetson 上运行 jetson-memory-audit/scripts/audit.sh,生成当前内存快照;然后从仓库根目录运行 python3 scripts/recommend.py --audit /tmp/audit.json --runtime auto --workload llm-server,必要时加入 --target-mb 或指定运行时。根据返回 JSON 中的 launch_flags 启动服务,之后重新运行审计验证。技能本身不会执行服务启停。
这个 Skill 与同类方案有什么区别?
该技能明确比较并选择 vLLM、SGLang、llama.cpp 和 TensorRT Edge-LLM:llama.cpp 面向最紧张的内存预算,vLLM 面向高吞吐连续批处理,SGLang 面向可编程工作流,TensorRT Edge-LLM 面向 NVIDIA 调优的生产服务。