开发与工程 ✓ NVIDIA · 官方 mixture-of-expertsmegatron-bridgedistributed-trainingparallel-foldingcuda-graphsfp8throughput-optimization

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

FollowSkills 评估 · FSRS-2.0
不推荐
53/ 100 五分制 2.7 / 5
信任安全17 / 25 · 3.4/5

技能仅提供配置与性能分析建议,没有脚本执行、凭据处理、数据外传或破坏性默认操作,且标明了论文来源;但未明确最小权限、用户确认、敏感数据处理、回滚方案或外部影响边界,因此扣分。

可靠稳定7 / 20 · 1.8/5

分阶段清单、并行网格、调度器和精度映射内部基本一致;但仅有静态文档,没有可执行实现、依赖锁定、关键路径复现、异常输入处理或可诊断失败反馈,受静态上限限制并扣分。

适用触发10 / 15 · 3.3/5

受众、MoE吞吐调优场景、触发短语和主要硬件映射较清楚;但非适用范围、输入输出契约、版本兼容性和中文环境支持不足,且未说明大陆网络下外部参考资料的可达性,因此扣分。

规范维护9 / 15 · 3.0/5

文档有前置摘要、分阶段流程、表格、陷阱和相关引用,技能卡还记录了所有者、用途和评估信息;但缺少标准Instructions与Examples章节、author/tags字段、明确版本变更记录、依赖安装说明和维护更新路径,且许可证元数据为NOASSERTION而文件内容存在Apache标注,扣分。

有效结果6 / 15 · 2.0/5

技能能直接生成fit→scale→profile→retune清单,并覆盖并行折叠、调度器、FP8和CUDA图范围;但没有真实产出样例或可复现实测,建议依赖用户结合具体模型、拓扑和版本重新判断,边际收益证据有限,按静态上限扣分。

证据核验4 / 10 · 2.0/5

包含论文引用、技能卡中的案例数值及提交的评估报告;但评估仅覆盖1个正向任务、无负向任务,报告缺少可独立复现的测试套件或CI覆盖,且核心建议主要依赖单一来源,故只能给有限分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 这是静态、低置信度审查;不要把技能中的硬件、版本、性能或配置建议视为已验证事实。
  • 执行任何并行度、精度、offload、dispatcher或CUDA Graph变更前,应在目标软件版本和硬件拓扑上确认兼容性,并保留可回退配置。
  • 建议补充标准Instructions、Examples、版本兼容矩阵、失败处理、维护负责人和可复现测试。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 Megatron Bridge 的混合专家模型训练性能调优。它以“内存墙、通信墙、计算与主机开销墙”为框架,指导用户先让训练运行稳定适配内存,再扩展并行规模、分析性能瓶颈并迭代调参。内容覆盖选择性重计算、卸载、Parallel Folding、专家并行、通信调度器、FP8 配置和 CUDA 图。它适合完整的 MoE 吞吐调优,也适合排查提交或配置变更后的吞吐回退。

它根据内存、通信、主机开销或计算瓶颈组织调优流程;建议模型并行、选择性重计算、卸载、数据并行、流水线并行、虚拟流水线并行、专家并行和上下文并行的组合;给出 Attention 与 MoE 的 Parallel Folding 网格;比较 alltoall、DeepEP 和 HybridEP 调度路径;提供 Hopper、Blackwell 的 FP8 配置建议;规划 dropless MoE 的部分 CUDA 图范围,并提示重计算、静态形状和额外显存之间的影响。它本身不执行训练、性能分析或配置修改。

  1. Megatron Bridge 工程师需要对完整 MoE 训练吞吐进行系统化调优时。
  2. 某次代码提交或配置变更后,训练吞吐下降且需要判断主要瓶颈时。
  3. 模型在预热阶段 OOM,需要在选择性重计算、并行布局和卸载之间做取舍时。
  4. 多节点训练中,注意力层与专家层需要不同并行布局时。
  5. H100、B200、GB200、GB300 或 NVL72 平台上,需要选择 MoE 调度器、精度模式或 CUDA 图策略时.

这个 Skill 有哪些优点和局限?

优点
  • 提供从适配内存到扩展、分析和重新调优的明确顺序。
  • 覆盖 MoE 训练中常见的并行、通信、精度、重计算和 CUDA 图决策。
  • 针对 Hopper、Blackwell、GB200、GB300 和 NVL72 给出差异化建议。
  • 明确指出吞吐、MFU、显存和动态形状之间的实际权衡。
局限
  • 主要是决策和排查指南,不会执行训练、分析 trace 或自动修改配置。
  • 没有提供完整可复制的训练命令、基准数据或特定模型的实测结果。
  • 建议依赖具体硬件、互连、模型形状和性能剖析结果,不能直接保证收益。
  • 来源未说明除 Megatron Bridge 外其他训练框架的适配情况。

如何安装这个 Skill?

使用仓库 README 提供的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill nemo-mbridge-perf-moe-optimization-workflow --yes

README 未说明该技能的独立安装包或额外依赖。

如何使用这个 Skill?

安装后,在支持该技能的代理中提出相关请求,例如“optimize MoE throughput”“MoE perf tuning”或“diagnose a MoE throughput regression”。也可以提及“Three Walls”“memory wall”“communication wall”或“compute wall”以触发相关工作流。来源未提供具体训练启动命令、配置文件模板或自动化脚本。

这个 Skill 与同类方案有什么区别?

技能明确比较了 alltoall、flex + DeepEP 与 flex + HybridEP 三种 MoE 调度路径,并比较选择性重计算与完整重计算、部分 CUDA 图与完整迭代 CUDA 图。来源没有提供与其他独立产品或框架的比较。

常见问题

这个技能会直接运行调优实验吗?
不会。它提供调优顺序、诊断思路和配置方向,但来源没有显示自动执行训练或性能分析的工具调用。
它适合哪些硬件?
内容明确覆盖 Hopper、H100、B200、Blackwell、GB200、GB300 和 NVL72 风格系统;具体效果仍取决于实际互连和工作负载。
使用 CUDA 图需要注意什么?
dropless MoE 建议先使用 attn、moe_router 和 moe_preprocess 的部分 TE 范围,并确认形状静态,同时预留数 GB 的额外显存。
技能本身是否收费或需要特殊权限?
来源未说明收费或特殊权限要求。README 说明可通过 skills CLI 从 NVIDIA/skills 安装。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

开发与工程 ✓ NVIDIA · 官方

MoE 分发器选型指南

根据硬件、专家并行规模和优化阶段选择 alltoall、DeepEP 或 HybridEP。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

相关 Skills