开发与工程 ✓ NVIDIA · 官方 moe-traininglong-contextmegatron-bridgecontext-parallelismselective-recomputecuda-graphsgpu-performance

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全14 / 25 · 2.8/5

内容仅提供训练配置与性能建议,未见恶意行为、凭据处理或数据外传;但未要求用户确认高成本 GPU 资源消耗,未说明数据流、回滚或失败恢复,外部引用也不够可核验,因此扣分。

可靠稳定7 / 20 · 1.8/5

正文结构一致,给出了 CP、重计算、dispatcher 和 CUDA Graph 的规则及配置族;但缺少可直接执行的脚本、环境前置条件、异常输入处理和失败诊断,提交的评估报告也不是本技能关键路径的可复现实验,因此受静态上限限制并扣分。

适用触发9 / 15 · 3.0/5

触发条件、目标用户和长上下文 MoE 场景较明确,覆盖约 16K–256K;但非适用边界、模型/版本兼容性、中文使用说明和大陆网络环境适配证据不足,且建议依赖特定 H100/GB200/NVL72 硬件。

规范维护8 / 15 · 2.7/5

有清晰标题、分层章节、配置示例、已知陷阱、Apache-2.0 许可、NVIDIA 所有者和版本/评估信息;但缺少 Instructions、Examples、作者与标签字段,引用使用仓库内部路径,维护责任和变更路径不完整。

有效结果6 / 15 · 2.0/5

CP~=seq_len/4096、DP 预算、选择性重计算及三个代表性布局可直接支持初步方案设计;但没有完整命令、环境校验、结果验证或替代方案比较,不能证明配置可直接运行,仍需较多工程复核。

证据核验4 / 10 · 2.0/5

card.yaml 提供了若干测量摘要,BENCHMARK.md 提供有限的外部评估记录;但没有原始日志、可执行测试、第三方链接或覆盖关键配置的 CI,主要性能主张仍难以独立复核,因此仅给有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 这是静态文档评估,未执行任何训练、配置或性能复现。
  • 不要将 CP~=seq_len/4096 或示例布局视为通用可运行配方;应先核对 Megatron Bridge、Transformer Engine、容器、CUDA、GPU 数量、显存和版本兼容性。
  • 这些建议可能导致显著 GPU 成本或 OOM;执行前应确认资源预算,并保留可回退的基线配置。
  • 性能数据缺少原始实验记录和直接来源链接,发布前应补充可审计证据。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 Megatron Bridge 训练长序列 MoE 模型的工程师。它说明如何估算上下文并行度(CP)、保留数据并行预算,并在选择性重计算、精度、调度器、流水线布局和优化器 CPU offload 之间做权衡。内容总结了 DSV3、Qwen3 和 Qwen3-Next 在 H100、GB200 与 NVL72 系统上的代表性配置模式。它适合处理 128K 级长上下文、MoE OOM、吞吐下降以及相关性能回归调查。

根据序列长度给出 CP 初始估算和布局建议;比较选择性重计算与完整重计算,并列出可优先重计算的 up_proj、norm、moe、moe_act 和 mlp 模块;讨论 DeepEP、HybridEP、TP、EP、PP、VPP、GBS、梯度累积和优化器 CPU offload 的组合;提供 DSV3 128K/256K 及 Qwen3 235B 128K 的代表性配置;说明 CUDA Graph 的静态形状要求与何时应采用 eager 执行。它提供训练指导,不会在文本中执行训练、调用外部工具或生成配置文件。

  1. 训练 128K 或更长序列的 MoE 模型,需要估算 CP、TP、EP 和 PP 的组合。
  2. 长上下文训练发生 OOM,想优先评估选择性重计算、精度降低或优化器 CPU offload。
  3. 调查某次提交导致长上下文 MoE 吞吐下降或显存占用增加。
  4. 在 H100 上参考 DSV3 的 128K 或 256K 配置模式。
  5. 在 GB200 或 NVL72 系统上评估 Qwen3-Next 或 Qwen3 235B 的并行与路由布局。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 CP sizing、选择性重计算、dispatcher、TP/EP/PP 布局和显存辅助策略。
  • 包含 DSV3、Qwen3-Next 和 Qwen3 235B 的具体配置家族与硬件背景。
  • 明确指出 DP 预算、GPU 数量可行性、静态 CUDA Graph 形状和容器/内核支持等实际限制。
  • 适合排查长上下文 MoE OOM 与吞吐退化,而不仅是给出单一的 fit-only 配方。
局限
  • 内容是指导性文档,不会自动运行训练、测量吞吐或验证硬件配置。
  • 代表性经验集中于 H100、GB200 和 NVL72,其他平台的适用性未在所给材料中证明。
  • 文档引用的详细资料和技能卡未随提示内容提供,无法据此核验更完整的实验数据。
  • 没有给出针对具体模型规模、显存容量或集群拓扑的自动配置流程。

如何安装这个 Skill?

使用 NVIDIA 技能集合的 CLI 安装指定技能:

npx skills add nvidia/skills --skill nemo-mbridge-perf-moe-long-context --yes

README 说明 CLI 会处理安装目标;也可以追加 --agent codex 或 --agent claude-code。除这些命令外,单个技能的 SKILL.md 未说明手动安装目录或运行时安装依赖。

如何使用这个 Skill?

安装后,在相关任务中向代理提出具体请求,例如:“为 128K tokens 的 MoE 训练估算 CP sizing,并比较 selective recompute 与 full recompute。”也可以描述长上下文 MoE OOM、吞吐回归、DeepEP/HybridEP 选择或 CUDA Graph 形状问题,让代理依据该技能给出配置分析。技能未提供独立 CLI、脚本或固定输出格式。

这个 Skill 与同类方案有什么区别?

该技能明确倾向于在较长上下文中使用选择性重计算,而不是直接采用完整重计算;它也建议在 CUDA Graph 需要静态形状时使用 CUDA Graph,否则对高度动态批次优先采用 eager 执行。它没有提供与其他独立产品或训练框架的比较。

常见问题

这个技能会自动修改或运行 Megatron Bridge 训练任务吗?
不会。所给 SKILL.md 提供配置和排障指导,没有脚本、命令或自动执行流程。
CP 应该从哪里开始估算?
文档建议先使用 CP 约等于 seq_len/4096 的估算,再四舍五入到实际可用的二次幂布局,同时检查 CP、EP、TP 和 PP 是否挤压了 DP。
它是否保证 128K 训练一定高效或不 OOM?
不保证。文档强调 GPU 数量、路由、并行度、重计算、批大小和容器/内核支持都会影响结果。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

开发与工程 ✓ NVIDIA · 官方

MoE 硬件配置参考

为不同 NVIDIA 平台提供 MoE 训练配置与吞吐规划参考。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

MoE 分发器选型指南

根据硬件、专家并行规模和优化阶段选择 alltoall、DeepEP 或 HybridEP。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

相关 Skills