NeMo MBridge MoE 性能优化工作流
系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。
技能仅提供配置与性能分析建议,没有脚本执行、凭据处理、数据外传或破坏性默认操作,且标明了论文来源;但未明确最小权限、用户确认、敏感数据处理、回滚方案或外部影响边界,因此扣分。
分阶段清单、并行网格、调度器和精度映射内部基本一致;但仅有静态文档,没有可执行实现、依赖锁定、关键路径复现、异常输入处理或可诊断失败反馈,受静态上限限制并扣分。
受众、MoE吞吐调优场景、触发短语和主要硬件映射较清楚;但非适用范围、输入输出契约、版本兼容性和中文环境支持不足,且未说明大陆网络下外部参考资料的可达性,因此扣分。
文档有前置摘要、分阶段流程、表格、陷阱和相关引用,技能卡还记录了所有者、用途和评估信息;但缺少标准Instructions与Examples章节、author/tags字段、明确版本变更记录、依赖安装说明和维护更新路径,且许可证元数据为NOASSERTION而文件内容存在Apache标注,扣分。
技能能直接生成fit→scale→profile→retune清单,并覆盖并行折叠、调度器、FP8和CUDA图范围;但没有真实产出样例或可复现实测,建议依赖用户结合具体模型、拓扑和版本重新判断,边际收益证据有限,按静态上限扣分。
包含论文引用、技能卡中的案例数值及提交的评估报告;但评估仅覆盖1个正向任务、无负向任务,报告缺少可独立复现的测试套件或CI覆盖,且核心建议主要依赖单一来源,故只能给有限分。
- 这是静态、低置信度审查;不要把技能中的硬件、版本、性能或配置建议视为已验证事实。
- 执行任何并行度、精度、offload、dispatcher或CUDA Graph变更前,应在目标软件版本和硬件拓扑上确认兼容性,并保留可回退配置。
- 建议补充标准Instructions、Examples、版本兼容矩阵、失败处理、维护负责人和可复现测试。
这个 Skill 能做什么,适合哪些场景?
该技能面向 Megatron Bridge 的混合专家模型训练性能调优。它以“内存墙、通信墙、计算与主机开销墙”为框架,指导用户先让训练运行稳定适配内存,再扩展并行规模、分析性能瓶颈并迭代调参。内容覆盖选择性重计算、卸载、Parallel Folding、专家并行、通信调度器、FP8 配置和 CUDA 图。它适合完整的 MoE 吞吐调优,也适合排查提交或配置变更后的吞吐回退。
它根据内存、通信、主机开销或计算瓶颈组织调优流程;建议模型并行、选择性重计算、卸载、数据并行、流水线并行、虚拟流水线并行、专家并行和上下文并行的组合;给出 Attention 与 MoE 的 Parallel Folding 网格;比较 alltoall、DeepEP 和 HybridEP 调度路径;提供 Hopper、Blackwell 的 FP8 配置建议;规划 dropless MoE 的部分 CUDA 图范围,并提示重计算、静态形状和额外显存之间的影响。它本身不执行训练、性能分析或配置修改。
- Megatron Bridge 工程师需要对完整 MoE 训练吞吐进行系统化调优时。
- 某次代码提交或配置变更后,训练吞吐下降且需要判断主要瓶颈时。
- 模型在预热阶段 OOM,需要在选择性重计算、并行布局和卸载之间做取舍时。
- 多节点训练中,注意力层与专家层需要不同并行布局时。
- H100、B200、GB200、GB300 或 NVL72 平台上,需要选择 MoE 调度器、精度模式或 CUDA 图策略时.
这个 Skill 有哪些优点和局限?
- 提供从适配内存到扩展、分析和重新调优的明确顺序。
- 覆盖 MoE 训练中常见的并行、通信、精度、重计算和 CUDA 图决策。
- 针对 Hopper、Blackwell、GB200、GB300 和 NVL72 给出差异化建议。
- 明确指出吞吐、MFU、显存和动态形状之间的实际权衡。
- 主要是决策和排查指南,不会执行训练、分析 trace 或自动修改配置。
- 没有提供完整可复制的训练命令、基准数据或特定模型的实测结果。
- 建议依赖具体硬件、互连、模型形状和性能剖析结果,不能直接保证收益。
- 来源未说明除 Megatron Bridge 外其他训练框架的适配情况。
如何安装这个 Skill?
使用仓库 README 提供的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill nemo-mbridge-perf-moe-optimization-workflow --yes
README 未说明该技能的独立安装包或额外依赖。
如何使用这个 Skill?
安装后,在支持该技能的代理中提出相关请求,例如“optimize MoE throughput”“MoE perf tuning”或“diagnose a MoE throughput regression”。也可以提及“Three Walls”“memory wall”“communication wall”或“compute wall”以触发相关工作流。来源未提供具体训练启动命令、配置文件模板或自动化脚本。
这个 Skill 与同类方案有什么区别?
技能明确比较了 alltoall、flex + DeepEP 与 flex + HybridEP 三种 MoE 调度路径,并比较选择性重计算与完整重计算、部分 CUDA 图与完整迭代 CUDA 图。来源没有提供与其他独立产品或框架的比较。