NeMo MBridge MoE 长上下文训练
为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。
内容仅提供训练配置与性能建议,未见恶意行为、凭据处理或数据外传;但未要求用户确认高成本 GPU 资源消耗,未说明数据流、回滚或失败恢复,外部引用也不够可核验,因此扣分。
正文结构一致,给出了 CP、重计算、dispatcher 和 CUDA Graph 的规则及配置族;但缺少可直接执行的脚本、环境前置条件、异常输入处理和失败诊断,提交的评估报告也不是本技能关键路径的可复现实验,因此受静态上限限制并扣分。
触发条件、目标用户和长上下文 MoE 场景较明确,覆盖约 16K–256K;但非适用边界、模型/版本兼容性、中文使用说明和大陆网络环境适配证据不足,且建议依赖特定 H100/GB200/NVL72 硬件。
有清晰标题、分层章节、配置示例、已知陷阱、Apache-2.0 许可、NVIDIA 所有者和版本/评估信息;但缺少 Instructions、Examples、作者与标签字段,引用使用仓库内部路径,维护责任和变更路径不完整。
CP~=seq_len/4096、DP 预算、选择性重计算及三个代表性布局可直接支持初步方案设计;但没有完整命令、环境校验、结果验证或替代方案比较,不能证明配置可直接运行,仍需较多工程复核。
card.yaml 提供了若干测量摘要,BENCHMARK.md 提供有限的外部评估记录;但没有原始日志、可执行测试、第三方链接或覆盖关键配置的 CI,主要性能主张仍难以独立复核,因此仅给有限分数。
- 这是静态文档评估,未执行任何训练、配置或性能复现。
- 不要将 CP~=seq_len/4096 或示例布局视为通用可运行配方;应先核对 Megatron Bridge、Transformer Engine、容器、CUDA、GPU 数量、显存和版本兼容性。
- 这些建议可能导致显著 GPU 成本或 OOM;执行前应确认资源预算,并保留可回退的基线配置。
- 性能数据缺少原始实验记录和直接来源链接,发布前应补充可审计证据。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用 Megatron Bridge 训练长序列 MoE 模型的工程师。它说明如何估算上下文并行度(CP)、保留数据并行预算,并在选择性重计算、精度、调度器、流水线布局和优化器 CPU offload 之间做权衡。内容总结了 DSV3、Qwen3 和 Qwen3-Next 在 H100、GB200 与 NVL72 系统上的代表性配置模式。它适合处理 128K 级长上下文、MoE OOM、吞吐下降以及相关性能回归调查。
根据序列长度给出 CP 初始估算和布局建议;比较选择性重计算与完整重计算,并列出可优先重计算的 up_proj、norm、moe、moe_act 和 mlp 模块;讨论 DeepEP、HybridEP、TP、EP、PP、VPP、GBS、梯度累积和优化器 CPU offload 的组合;提供 DSV3 128K/256K 及 Qwen3 235B 128K 的代表性配置;说明 CUDA Graph 的静态形状要求与何时应采用 eager 执行。它提供训练指导,不会在文本中执行训练、调用外部工具或生成配置文件。
- 训练 128K 或更长序列的 MoE 模型,需要估算 CP、TP、EP 和 PP 的组合。
- 长上下文训练发生 OOM,想优先评估选择性重计算、精度降低或优化器 CPU offload。
- 调查某次提交导致长上下文 MoE 吞吐下降或显存占用增加。
- 在 H100 上参考 DSV3 的 128K 或 256K 配置模式。
- 在 GB200 或 NVL72 系统上评估 Qwen3-Next 或 Qwen3 235B 的并行与路由布局。
这个 Skill 有哪些优点和局限?
- 覆盖 CP sizing、选择性重计算、dispatcher、TP/EP/PP 布局和显存辅助策略。
- 包含 DSV3、Qwen3-Next 和 Qwen3 235B 的具体配置家族与硬件背景。
- 明确指出 DP 预算、GPU 数量可行性、静态 CUDA Graph 形状和容器/内核支持等实际限制。
- 适合排查长上下文 MoE OOM 与吞吐退化,而不仅是给出单一的 fit-only 配方。
- 内容是指导性文档,不会自动运行训练、测量吞吐或验证硬件配置。
- 代表性经验集中于 H100、GB200 和 NVL72,其他平台的适用性未在所给材料中证明。
- 文档引用的详细资料和技能卡未随提示内容提供,无法据此核验更完整的实验数据。
- 没有给出针对具体模型规模、显存容量或集群拓扑的自动配置流程。
如何安装这个 Skill?
使用 NVIDIA 技能集合的 CLI 安装指定技能:
npx skills add nvidia/skills --skill nemo-mbridge-perf-moe-long-context --yes
README 说明 CLI 会处理安装目标;也可以追加 --agent codex 或 --agent claude-code。除这些命令外,单个技能的 SKILL.md 未说明手动安装目录或运行时安装依赖。
如何使用这个 Skill?
安装后,在相关任务中向代理提出具体请求,例如:“为 128K tokens 的 MoE 训练估算 CP sizing,并比较 selective recompute 与 full recompute。”也可以描述长上下文 MoE OOM、吞吐回归、DeepEP/HybridEP 选择或 CUDA Graph 形状问题,让代理依据该技能给出配置分析。技能未提供独立 CLI、脚本或固定输出格式。
这个 Skill 与同类方案有什么区别?
该技能明确倾向于在较长上下文中使用选择性重计算,而不是直接采用完整重计算;它也建议在 CUDA Graph 需要静态形状时使用 CUDA Graph,否则对高度动态批次优先采用 eager 执行。它没有提供与其他独立产品或训练框架的比较。