开发与工程 ✓ NVIDIA · 官方 mixture-of-expertstoken-dispatcherdeep-ephybrid-epexpert-parallelismnemo-mbridgegpu-performance

MoE 分发器选型指南

根据硬件、专家并行规模和优化阶段选择 alltoall、DeepEP 或 HybridEP。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全17 / 25 · 3.4/5

内容主要提供配置选择和性能排查建议,没有凭据访问、数据外传或破坏性默认操作,并披露了后端导入失败和拓扑不匹配风险;但未明确用户确认、依赖安全校验、回滚方案或完整数据流边界,且许可证元数据为 NOASSERTION,因此扣分。

可靠稳定8 / 20 · 2.0/5

SKILL.md 内部结构一致,覆盖 alltoall、DeepEP、HybridEP 的选择条件、关键参数和导入失败反馈;但没有该技能目录内的可执行测试或关键路径复现,且若干性能结论缺少可诊断的验证步骤。静态评估上限为 10,故仅给 8 分。

适用触发10 / 15 · 3.3/5

目标用户、硬件场景、EP 规模和触发短语较清楚,也说明了 HybridEP 的 NVL72 限制及后端可用性门槛;但未系统声明非适用范围、输入输出契约或中文使用支持,适合环境的边界证据有限,故扣分。

规范维护8 / 15 · 2.7/5

文档按硬件、模型、参数、交互和陷阱分层,许可证、Owner、验证日期和版本信息在配套卡片中出现;但缺少推荐的 Instructions、Examples、author、tags,缺少明确 changelog 和维护责任/更新流程,且相关版本日期存在不一致,故扣分。

有效结果6 / 15 · 2.0/5

可直接给出硬件与 EP 规模下的 dispatcher 建议、flex backend 配置名、SM 默认值以及导入失败的正确解释,核心任务价值明确;但缺少可直接运行的完整配置示例和独立验证,部分性能收益仍需用户重新测量。按静态上限 7 分给 6 分。

证据核验3 / 10 · 1.5/5

存在提交的评估报告、单个正向 smoke task 和若干测量摘要,提供了一定审计线索;但评估数据只有一个任务、缺少负向触发测试,性能来源是未附原始材料的摘要,无法独立复现。按静态上限 5 分给 3 分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要把 DeepEP 或 HybridEP 的导入失败当作性能数据;应先确认目标容器中的运行时包,再在相同容器、路由模式、PP 布局和 CUDA Graph 范围下比较。
  • HybridEP 依赖 NVLink 域拓扑;NUM_OF_HYBRID_EP_RANKS_PER_NVLINK_DOMAIN 不匹配可能导致性能下降甚至正确性问题。
  • 文档中的性能比例和推荐结论应视为经验性摘要,发布前应补充原始 benchmark、版本矩阵、负向触发测试和完整可运行示例。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NeMo MBridge 的混合专家(MoE)性能调优,帮助用户在 alltoall、DeepEP 和 HybridEP 之间做选择。它按 H100、B200、GB200/GB300 NVL72 等硬件,以及专家并行度和模型族提供决策建议。内容还涵盖后端可用性检查、SM 数调优、路由模式、CUDA Graph、CPU 亲和性和流水线布局等影响因素。它适合性能回归排查和首次 bring-up,但不是独立的基准测试工具。

提供按硬件、EP 度数和模型族组织的分发器决策表;说明如何配置 DeepEP 和 HybridEP 的 flex 后端及通信 SM 数;提醒在比较性能前确认对应运行时包已安装;解释 alltoall、DeepEP 和 HybridEP 在 DSV3、Qwen3、Qwen3-Next 与 MoE VLM 场景中的已提供证据;列出 CUDA Graph、EP overlap、FP8、CPU 亲和性和流水线布局等关键交互与常见故障原因。

  1. NeMo MBridge 用户在 H100 或 B200 上进行跨节点 EP bring-up,需要在 alltoall 与 DeepEP 之间选择时。
  2. 用户在 GB200 或 GB300 NVL72 上运行大规模 MoE,既关注吞吐也关注显存余量时。
  3. 工程师发现 MoE 性能回归或崩溃,怀疑近期修改了 dispatcher 配置时。
  4. 团队比较 DSV3、Qwen3、Qwen3-Next 或 MoE VLM 的 BF16、FP8 性能时。

这个 Skill 有哪些优点和局限?

优点
  • 针对硬件、EP 规模和模型族提供具体的 alltoall、DeepEP、HybridEP 选择建议。
  • 明确区分后端缺失导致的环境失败与真实性能数据。
  • 覆盖通信 SM 数、NVLink 域大小、路由模式和 CUDA Graph 等实际调优因素。
  • 同时考虑吞吐、显存余量、正确性 bring-up 和回归排查。
局限
  • DeepEP 和 HybridEP 的收益依赖硬件、拓扑、路由模式及整体软件栈,不能视为普遍结论。
  • 提供的 H100 Qwen3 30B 运行中,DeepEP 和 HybridEP 因运行时包未安装而未完成迭代,因此没有 H100 flex 分发器吞吐排名。
  • 来源材料未提供该技能自身的测试套件、独立复现实验脚本或完整基准数据。
  • 技能主要给出决策和配置指导,不会自动执行训练、性能测试或环境修复。

如何安装这个 Skill?

使用仓库 README 提供的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill nemo-mbridge-perf-moe-dispatcher-selection --yes

README 说明 CLI 会将技能安装到所选目标;不需要克隆仓库或手动复制目录。

如何使用这个 Skill?

安装后,在相关任务中直接向 agent 提出问题,例如:"Which dispatcher should I use for Qwen3 MoE on a GB200 NVL72 system?" 或 "Trace this MoE regression after changing the dispatcher configuration." 技能会根据硬件、EP 度数、优化阶段和运行时包可用性给出选择与调优建议。来源未提供更具体的启动脚本或独立运行命令。

这个 Skill 与同类方案有什么区别?

该技能直接比较三种 MoE token dispatcher:alltoall 适合首次正确性 bring-up、小规模 EP 和调试;DeepEP 通常适合 Hopper、B200 及跨节点 EP;HybridEP 通常适合 GB200/GB300 NVL72、大 EP 度数和显存压力较大的场景。

常见问题

使用 DeepEP 或 HybridEP 时最常见的失败原因是什么?
对应运行时包未安装会在模型构建阶段失败,早于第一次迭代;此时应记录为环境限制,不能与完成的 alltoall 作性能比较。
HybridEP 是否适用于所有 GPU?
不是。指南将其重点定位在 GB200 或 GB300 NVL72,并强调它对 NVLink 拓扑敏感。
安装这个技能是否需要额外付费或特殊权限?
来源只说明通过 skills CLI 安装,没有说明额外费用或权限要求。DeepEP、HybridEP 运行时包是否可用则取决于目标容器环境。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

MoE 硬件配置参考

为不同 NVIDIA 平台提供 MoE 训练配置与吞吐规划参考。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 自适应调优

基于运行时信号,以可测量方式调优 NeMo Relay 插件行为。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

CuTile 自动调优指南

为 CuTile GPU 内核设计、实现并验证低开销的自动调优流程。

开发与工程 ✓ NVIDIA · 官方

NeMo-RL 自动研究助手

将 NeMo-RL 研究目标转化为可复现的迭代实验。

开发与工程 ✓ NVIDIA · 官方

TileGym cuTile 内核性能优化

通过剖析、瓶颈诊断和逐项调优,系统降低 TileGym cuTile GPU 内核延迟。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 安装助手

为 CLI、语言包和主流框架选择并验证 NeMo Relay 安装路径。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 快速上手

帮助首次使用 NeMo Relay 的用户通过最小试验验证可观测执行价值。

开发与工程 ✓ NVIDIA · 官方

NeMo Relay 插件构建指南

帮助将可复用的 NeMo Relay 运行时行为封装为可配置插件。

自动化与运维 ✓ NVIDIA · 官方

NeMo Relay 可观测性插件

为 NeMo Relay 选择并配置事件与追踪导出。

相关 Skills