开发与工程 ✓ NVIDIA · 官方 mixture-of-expertsexpert-parallelismcommunication-overlapmegatron-bridgeflex-dispatcherdeepepcuda-graphs

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

FollowSkills 评估 · FSRS-2.0
不推荐
56/ 100 五分制 2.8 / 5
信任安全18 / 25 · 3.6/5

技能范围限于配置建议和性能命令,明确要求先验证前置条件,并提示不要在日志中泄露秘密;未见恶意行为或过度权限。但缺少明确的用户确认、回滚步骤、依赖版本锁定和数据流说明,因此扣分。

可靠稳定8 / 20 · 2.0/5

说明了 EP、dispatcher、精度、PP/VPP、重计算和 CUDA Graph 约束,并提供异常启动验证方式。可是静态材料未包含该技能专属的可执行测试或完整失败诊断,依赖和运行环境也未锁定,因此仅给有限分数。

适用触发11 / 15 · 3.7/5

触发词、适用场景、前置条件和非适用情况较清晰,且不依赖海外在线服务。未说明中文使用方式、更多硬件/版本边界、回归排查范围和不支持的模型配置,因此扣分。

规范维护9 / 15 · 3.0/5

SKILL.md 结构清楚,包含快速决策、启用方式、前置条件、陷阱和验证;许可证、所有者、版本和更新线索可从附属材料及仓库上下文获得。缺少推荐的 Instructions 和 Examples 章节,作者、变更记录、稳定参数策略和维护责任仍不充分,因此扣分。

有效结果6 / 15 · 2.0/5

核心任务可直接得到配置项、约束、命令和方向性基准数字,且明确说明收益依赖 workload。只有一个正向评测任务,短跑结果非 release-grade,缺少代表性输出和与替代方案的比较,因此按静态上限保守给分。

证据核验4 / 10 · 2.0/5

提供代码锚点、测试路径、评测报告和明确的短跑数据,并区分方向性证据与结论。材料未包含被审查源文件内容、可独立复现实验记录或多组交叉验证,且部分验证状态为 unclear,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要将 2026-05-18 的 H100 x16 短跑结果视为通用性能保证;应在目标容器、模型、硬件和通信拓扑上复测。
  • 启用 overlap 或 delay_wgrad_compute 前应保存原配置并准备回滚;当前技能未提供系统化回滚步骤。
  • 需确认 Megatron Bridge、Transformer Engine、PyTorch、Triton、CUDA 和 DeepEP 版本兼容性;技能未锁定版本。
  • 评测报告仅含一个正向任务且未执行本次静态审查中的复现,不能证明负向触发、边界配置或生产稳定性。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向已完成正确性验证、正在优化吞吐的 Megatron Bridge MoE 训练任务。它涵盖专家并行 dispatch/combine 重叠、flex dispatcher 后端以及 expert wgrad 调度。启用前需要满足专家并行、MoE、精度和流水线并行等前置条件。文档还提供短时 H100 x16 测试结果,但明确说明结果仅具方向性,不能证明所有工作负载都能获益。

指导用户设置 comm_overlap.overlap_moe_expert_parallel_comm、可选的 comm_overlap.delay_wgrad_compute,并在 dispatch overlap 时关闭 model.moe_shared_expert_overlap。它检查专家并行大小、MoE 专家数、dispatcher 类型、精度及 PP/VPP 条件,说明如何激活 flex dispatcher,并定位相关配置、验证逻辑和单元测试。它还提供使用 uv run python scripts/performance/run_script.py 的短时性能 smoke 命令,以及 fused MoE permutation 失败时的隔离测试参数。

  1. Megatron Bridge 用户在 `EP > 1` 且 profile 中 dispatch 或 combine 通信占据明显时间时调优吞吐。
  2. 工程师追踪 MoE 吞吐回退,并怀疑 `overlap_moe_expert_parallel_comm` 配置变更导致问题。
  3. 使用 flex dispatcher 或 DeepEP 的训练者检查 dispatcher 类型与后端设置是否同时生效。
  4. 启用 pipeline parallelism 的用户验证 VPP 是否已配置,以避免 MoE 重叠调度无法正确交错。
  5. 性能工程师在 H100 多 GPU 环境中逐项比较 EP overlap 与 delayed wgrad 的短时表现。

这个 Skill 有哪些优点和局限?

优点
  • 给出明确的启用配置、前置条件和冲突项。
  • 覆盖 alltoall、flex dispatcher、DeepEP 和 delayed wgrad 相关路径。
  • 提供代码锚点、初始化验证方式和可复制的性能 smoke 命令。
  • 明确区分方向性测试证据与发布级结论。
局限
  • 只适用于 MoE 专家并行通信重叠,不是通用的训练性能调优技能。
  • 要求 EP 大于 1、多个 MoE 专家、特定 dispatcher 和 BF16/FP16;PP 还要求 VPP。
  • full recompute 与该路径不理想,CUDA graph 范围和 delayed wgrad 还会增加限制。
  • 性能收益依赖通信在 step time 中的占比;提供的 H100 x16 结果是短时 smoke,未证明普遍收益。
  • README 虽说明集合级签名、评估和维护,但给定技能正文未提供其自身的测试结果或签名文件。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装:npx skills add nvidia/skills --skill nemo-mbridge-perf-moe-comm-overlap --yes。README 未说明该单个技能的其他专用安装方式。

如何使用这个 Skill?

在已稳定的 dispatcher、路由模式和 recompute 计划上,向代理提出:“调优 Megatron Bridge 的 MoE communication overlap,检查 EP overlap、flex dispatcher 和 expert wgrad scheduling。”随后按技能设置通信重叠配置,确认 expert_model_parallel_size > 1num_moe_experts > 1、dispatcher 为 alltoallflex、精度为 BF16/FP16;若使用 PP,设置非 None 的 VPP。通过初始化日志和 comm_overlap.py 校验确认启用,再使用提供的性能命令逐次只改变一个 overlap 参数。

常见问题

这个技能适合在训练 bring-up 初期使用吗?
不适合。正文建议先稳定 dispatcher、路由模式和 recompute 计划,再进行吞吐调优。
启用 flex dispatcher 后端就足够了吗?
不够。必须同时设置 `moe_token_dispatcher_type = "flex"`;仅设置 `moe_flex_dispatcher_backend` 不会激活 flex dispatch。
为什么 PP 训练需要 VPP?
MoE overlap 在启用 pipeline parallelism 时要求 `virtual_pipeline_model_parallel_size` 为非 `None`,否则调度无法正确交错。
EP overlap 一定会提升性能吗?
不会。正文指出收益取决于工作负载,尤其取决于 dispatch 通信是否已经明显占用 step time。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

MoE 分发器选型指南

根据硬件、专家并行规模和优化阶段选择 alltoall、DeepEP 或 HybridEP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

开发与工程 ✓ NVIDIA · 官方

MoE 硬件配置参考

为不同 NVIDIA 平台提供 MoE 训练配置与吞吐规划参考。

相关 Skills