Jetson vLLM 推测解码调优
为 Jetson vLLM 服务配置推测解码,降低单流生成延迟。
技能明确限定 Jetson 型号、并发范围和内存前提,提供禁用回退、OOM 处理和基准验证建议,未见恶意、凭据窃取或破坏性默认操作。扣分原因是未明确要求用户确认、未充分披露模型仓库和容器的外部数据流与依赖信任边界,且使用 latest 镜像可能削弱可控性。
指令路径、EAGLE-3 与 draft-model 分支、版本条件、OOM 和性能回退均有说明。静态材料没有目标技能的可执行测试套件,基准报告缺少原始数据集,且部分版本与兼容性声明无法在文件内复现,因此按静态上限保守评分。
适用场景、Jetson 型号、TPOT/TTFT 条件、并发边界和不适用设备均较清楚。扣分原因是缺少输入输出示例和更精确的触发排除条件,未提供中文使用支持;容器、模型仓库和 NVIDIA 服务的中国大陆网络可达性也未被说明。
文档结构清楚,包含用途、前置条件、安装运行约束、验证、限制、错误处理和交接技能;版本、许可证和 NVIDIA 归属可见。扣分原因是缺少推荐的 Examples 章节,作者格式不符合静态检查要求,skill-card 与 frontmatter 的许可证表述不完全一致,且没有明确变更日志、维护负责人联系方式或更新路径。
该技能直接给出两种 speculative-config 配置、设备差异、显存调整和前后基准判定标准,能够覆盖核心配置任务。扣分原因是模型仓库 ID、基础 serve 命令和实际 benchmark 输出仍需用户补全,缺少目标技能自身的可复现结果;静态审查不能证明性能收益,因此不超过 7 分。
技能引用 vLLM 文档和 Jetson AI Lab 教程,并附有评估报告和固定修订版本信息。扣分原因是报告称有外部评估但未提供原始数据集或逐项记录,技能本身没有覆盖关键路径的测试,主要技术断言缺少文件内逐条证据,因此仅给有限可审计分数。
- 启用前应确认目标模型与 EAGLE-3 head 或 draft model 的兼容性、镜像来源、版本和显存余量;建议固定镜像与模型版本,不要直接依赖 latest。
- 必须保存非 speculative 基线并按文档阈值复测;启动 OOM 或性能退化时移除 speculative-config。
- 模型仓库、容器拉取和 NVIDIA 相关服务的中国大陆网络可达性及组织合规性未在技能中说明。
这个 Skill 能做什么,适合哪些场景?
该技能面向 Jetson Thor 和 AGX Orin 上已有的 vLLM 服务,通过 EAGLE-3 或草稿模型配置推测解码。它重点处理 TPOT/ITL 较高、并发较低的解码场景,并强调显存余量比草稿模型质量更关键。技能会指导用户调整 vLLM 启动参数,并在启用前后进行基准测试。Orin Nano/NX、高并发或显存紧张的部署通常不适合使用它。
指导用户在现有 vLLM serve 命令中追加 --speculative-config,选择 eagle3 或 draft_model,设置草稿模型、推测 token 数和张量并行大小;根据 Thor 或 AGX Orin 调整 token 数和 gpu-memory-utilization;使用 jetson-llm-benchmark 在并发 1 下比较启用前后的 throughput_tok_s 与 tpot_ms_p50,并在收益不足、吞吐回退或启动 OOM 时移除配置、降低显存利用率或改用更小的草稿模型。
- Jetson Thor 用户希望改善单流 vLLM 文本生成速度,且目标模型已有兼容的 EAGLE-3 head。
- AGX Orin 用户的 TTFT 尚可,但每 token 延迟较高,且服务并发不超过 2。
- 部署团队需要用基准数据判断推测解码是否带来至少 30% 的单流吞吐提升。
- 启用推测解码后 vLLM 启动 OOM,需要根据技能建议回退或释放显存。
这个 Skill 有哪些优点和局限?
- 提供 EAGLE-3 优先、草稿模型回退的明确配置模板。
- 针对 Thor 与 AGX Orin 给出不同的推测 token 起始值。
- 包含启动 OOM、参数拒绝和基准回退处理。
- 强调启用前后基准测试,避免假设一定加速。
- 仅适合解码受限且单流或低并发的场景。
- Orin Nano/NX 通常没有同时容纳目标模型和草稿模型的显存余量。
- 需要兼容的 EAGLE-3 head 或同系列草稿模型,来源未提供具体模型 ID。
- 来源未展示该具体技能的独立测试结果或评测数据。
如何安装这个 Skill?
使用仓库 README 中的 skills CLI 安装方式:npx skills add nvidia/skills --skill jetson-speculative-decoding --yes。README 未说明该技能的专用安装脚本或其他运行时安装步骤。
如何使用这个 Skill?
先准备可工作的 jetson-llm-serve vLLM 服务命令和 jetson-llm-benchmark 基线,然后请求代理:"Tune my Jetson vLLM server with speculative decoding and benchmark the result." 代理应根据目标模型是否有 EAGLE-3 head、Jetson 型号和显存余量选择配置。实际 EAGLE-3 head 或草稿模型仓库 ID 未在来源中提供,需要用户补充。
这个 Skill 与同类方案有什么区别?
该技能明确将推测解码与高并发下的连续批处理进行取舍:并发达到 8 或更高时,批量解码通常优于推测解码。发生启动 OOM 时,可转交 jetson-inference-mem-tune。