NeMo MBridge MoE VLM 训练指南
帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。
该技能是只读式训练建议,不要求凭据、数据上传或破坏性操作;用途、适用硬件和部分风险可见,且技能声明 Apache-2.0、仓库提供安全披露渠道并有 NVIDIA 归属。扣分原因是没有明确的用户确认、权限边界、回滚方案、敏感数据处理或依赖安全说明;发布元数据仍为 NOASSERTION。
FSDP/3D-parallel决策逻辑、配置族和常见陷阱前后一致,且附带评估报告显示静态校验通过、有限任务评估可运行。扣分原因是没有脚本、安装要求、版本兼容矩阵、可复现命令或异常输入/失败反馈;评估只有一个正向任务且未提供可独立复核的执行材料。静态审查上限限制该项不超过10分。
目标受众、触发词、FSDP与3D-parallel适用场景以及Qwen3-VL/Qwen3.5、GB200/B200范围较清楚,并披露FP8、长上下文、架构覆盖等限制。扣分原因是输入、输出、非适用边界和语义触发规则仍不够具体;未说明中文支持,且对硬件和 Megatron Bridge 环境依赖较强。
文档结构清晰,包含决策指南、调优旋钮、配置族、兼容性、陷阱和已知限制;技能卡提供 NVIDIA owner、Apache 2.0、验证日期和版本线索。扣分原因是缺少 Instructions 和 Examples,缺少 author/tags 元数据、依赖/安装说明、FAQ、明确 changelog 与维护更新路径;技能卡版本与评估修订信息也未完全对齐。
内容能直接支持比较FSDP优先与3D-parallel路径,并给出TP/CP/PP/EP/ETP、HybridEP、MBS、重计算、CUDA Graph和真实图像数据等实用指导;评估报告显示有限任务的正确性和有效性结果较好。扣分原因是没有可直接运行的训练命令或完整配置,性能结论是四舍五入的经验总结,适用架构和硬件范围窄,实际使用仍需较多环境适配和验证。静态审查上限限制该项不超过7分。
技能卡列出已测配置、硬件规模和内部性能跟踪器名称,BENCHMARK.md提供有限的评估过程、任务和结果,因而具备一定审计线索。扣分原因是没有原始实验记录、外部可核查引用、提交的关键路径测试或多来源交叉证据;评估样本仅一个任务,不能独立复现主要性能结论。静态审查上限限制该项不超过5分。
- 不要把mock-data性能当作真实VLM吞吐量;必须使用真实或逼真的图像负载,并按有效token和工作负载形状归一化比较。
- 配置建议针对特定Qwen架构、Megatron Bridge版本和GB200/B200拓扑;在其他模型、编码器、GPU或并行布局上应先做小规模验证。
- 技能没有提供可执行配置、安装依赖、失败诊断或回滚步骤;执行前需要由使用者补齐环境检查和实验恢复方案。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用 Megatron Bridge 训练 MoE 视觉语言模型的工程师。它比较 FSDP 与 3D 并行,建议先用 FSDP 完成可靠的首次运行,再根据吞吐需求迁移到 3D 并行。内容覆盖真实多模态数据、重计算、MBS、CUDA Graph、HybridEP 和 ETP 等关键调优因素。它也适合排查导致 MoE VLM 训练失败或显存溢出的提交变更。
比较 FSDP 和 3D 并行的适用场景;根据模型稳定性、流水线边界和显存目标提供方案选择建议;解释真实图像数据与 mock 数据对性能判断的影响;指导冻结视觉栈、扫描 MBS、从完整重计算转向选择性重计算、调整 CUDA Graph 范围,以及在必要时采用 ETP;列出 GB200 FSDP-first 与 3D-parallel 配置族,并提示视觉编码器、投影层和解码器的独立分析方法。
- 正在首次 bring-up 新 MoE VLM、需要优先获得可靠运行结果的训练工程师。
- 在 GB200 或 B200 上调试 Qwen3-VL 类模型的显存、重计算或吞吐问题的工程师。
- 发现 mock 数据性能明显高于真实图像输入、需要重新建立可信基准的团队。
- 调查某次提交导致 MoE VLM 训练失败或 OOM 的开发者。
- 已有稳定 FSDP 运行、准备评估 3D 并行吞吐上限的性能工程师。
这个 Skill 有哪些优点和局限?
- 明确给出 FSDP-first 到 3D 并行的渐进式决策路径。
- 覆盖真实多模态输入、显存适配和稳态吞吐之间的实际权衡。
- 提供 HybridEP、MBS、重计算、CUDA Graph 和 ETP 等具体调优方向。
- 包含 GB200 与 B200 的经验性差异及常见陷阱。
- 主要是实践指导,不包含可直接执行的训练脚本或完整实验流程。
- 配置示例较为概括,未给出具体模型、批次大小或硬件拓扑数值。
- supplied 内容没有提供独立的基准数据、测试套件或平台兼容矩阵。
- 结论集中于 Qwen3-VL、Qwen3-Next 等实验经验,不能据此保证其他模型或硬件的结果。
如何安装这个 Skill?
使用仓库 README 给出的命令安装整个 NVIDIA skills 集合:npx skills add nvidia/skills。若 CLI 提供交互选择,请选择 nemo-mbridge-perf-moe-vlm-training;源材料没有提供该技能单独复制到目标目录的步骤。
如何使用这个 Skill?
安装后,在相关任务中直接描述需求,例如:“训练 MoE VLM 时比较 FSDP 与 3D 并行,并排查 Qwen3-VL 的 OOM。”也可以说明硬件、是否使用真实图像数据、MBS、重计算和视觉栈冻结状态,以便按该技能的决策指南分析。
这个 Skill 与同类方案有什么区别?
核心比较是 FSDP 与 3D 并行:FSDP 更适合首次 bring-up、显存优先和复杂流水线边界;3D 并行在模型稳定、流水线布局清晰且有时间进行调参时,可能提供更高吞吐上限。