MoE 分发器选型指南
根据硬件、专家并行规模和优化阶段选择 alltoall、DeepEP 或 HybridEP。
内容主要提供配置选择和性能排查建议,没有凭据访问、数据外传或破坏性默认操作,并披露了后端导入失败和拓扑不匹配风险;但未明确用户确认、依赖安全校验、回滚方案或完整数据流边界,且许可证元数据为 NOASSERTION,因此扣分。
SKILL.md 内部结构一致,覆盖 alltoall、DeepEP、HybridEP 的选择条件、关键参数和导入失败反馈;但没有该技能目录内的可执行测试或关键路径复现,且若干性能结论缺少可诊断的验证步骤。静态评估上限为 10,故仅给 8 分。
目标用户、硬件场景、EP 规模和触发短语较清楚,也说明了 HybridEP 的 NVL72 限制及后端可用性门槛;但未系统声明非适用范围、输入输出契约或中文使用支持,适合环境的边界证据有限,故扣分。
文档按硬件、模型、参数、交互和陷阱分层,许可证、Owner、验证日期和版本信息在配套卡片中出现;但缺少推荐的 Instructions、Examples、author、tags,缺少明确 changelog 和维护责任/更新流程,且相关版本日期存在不一致,故扣分。
可直接给出硬件与 EP 规模下的 dispatcher 建议、flex backend 配置名、SM 默认值以及导入失败的正确解释,核心任务价值明确;但缺少可直接运行的完整配置示例和独立验证,部分性能收益仍需用户重新测量。按静态上限 7 分给 6 分。
存在提交的评估报告、单个正向 smoke task 和若干测量摘要,提供了一定审计线索;但评估数据只有一个任务、缺少负向触发测试,性能来源是未附原始材料的摘要,无法独立复现。按静态上限 5 分给 3 分。
- 不要把 DeepEP 或 HybridEP 的导入失败当作性能数据;应先确认目标容器中的运行时包,再在相同容器、路由模式、PP 布局和 CUDA Graph 范围下比较。
- HybridEP 依赖 NVLink 域拓扑;NUM_OF_HYBRID_EP_RANKS_PER_NVLINK_DOMAIN 不匹配可能导致性能下降甚至正确性问题。
- 文档中的性能比例和推荐结论应视为经验性摘要,发布前应补充原始 benchmark、版本矩阵、负向触发测试和完整可运行示例。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NeMo MBridge 的混合专家(MoE)性能调优,帮助用户在 alltoall、DeepEP 和 HybridEP 之间做选择。它按 H100、B200、GB200/GB300 NVL72 等硬件,以及专家并行度和模型族提供决策建议。内容还涵盖后端可用性检查、SM 数调优、路由模式、CUDA Graph、CPU 亲和性和流水线布局等影响因素。它适合性能回归排查和首次 bring-up,但不是独立的基准测试工具。
提供按硬件、EP 度数和模型族组织的分发器决策表;说明如何配置 DeepEP 和 HybridEP 的 flex 后端及通信 SM 数;提醒在比较性能前确认对应运行时包已安装;解释 alltoall、DeepEP 和 HybridEP 在 DSV3、Qwen3、Qwen3-Next 与 MoE VLM 场景中的已提供证据;列出 CUDA Graph、EP overlap、FP8、CPU 亲和性和流水线布局等关键交互与常见故障原因。
- NeMo MBridge 用户在 H100 或 B200 上进行跨节点 EP bring-up,需要在 alltoall 与 DeepEP 之间选择时。
- 用户在 GB200 或 GB300 NVL72 上运行大规模 MoE,既关注吞吐也关注显存余量时。
- 工程师发现 MoE 性能回归或崩溃,怀疑近期修改了 dispatcher 配置时。
- 团队比较 DSV3、Qwen3、Qwen3-Next 或 MoE VLM 的 BF16、FP8 性能时。
这个 Skill 有哪些优点和局限?
- 针对硬件、EP 规模和模型族提供具体的 alltoall、DeepEP、HybridEP 选择建议。
- 明确区分后端缺失导致的环境失败与真实性能数据。
- 覆盖通信 SM 数、NVLink 域大小、路由模式和 CUDA Graph 等实际调优因素。
- 同时考虑吞吐、显存余量、正确性 bring-up 和回归排查。
- DeepEP 和 HybridEP 的收益依赖硬件、拓扑、路由模式及整体软件栈,不能视为普遍结论。
- 提供的 H100 Qwen3 30B 运行中,DeepEP 和 HybridEP 因运行时包未安装而未完成迭代,因此没有 H100 flex 分发器吞吐排名。
- 来源材料未提供该技能自身的测试套件、独立复现实验脚本或完整基准数据。
- 技能主要给出决策和配置指导,不会自动执行训练、性能测试或环境修复。
如何安装这个 Skill?
使用仓库 README 提供的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill nemo-mbridge-perf-moe-dispatcher-selection --yes
README 说明 CLI 会将技能安装到所选目标;不需要克隆仓库或手动复制目录。
如何使用这个 Skill?
安装后,在相关任务中直接向 agent 提出问题,例如:"Which dispatcher should I use for Qwen3 MoE on a GB200 NVL72 system?" 或 "Trace this MoE regression after changing the dispatcher configuration." 技能会根据硬件、EP 度数、优化阶段和运行时包可用性给出选择与调优建议。来源未提供更具体的启动脚本或独立运行命令。
这个 Skill 与同类方案有什么区别?
该技能直接比较三种 MoE token dispatcher:alltoall 适合首次正确性 bring-up、小规模 EP 和调试;DeepEP 通常适合 Hopper、B200 及跨节点 EP;HybridEP 通常适合 GB200/GB300 NVL72、大 EP 度数和显存压力较大的场景。