开发与工程 ✓ NVIDIA · 官方 megatron-bridgemodel-parallelismtensor-parallelismpipeline-parallelismexpert-parallelismcontext-parallelismdistributed-training

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

FollowSkills 评估 · FSRS-2.0
不推荐
58/ 100 五分制 2.9 / 5
信任安全18 / 25 · 3.6/5

技能仅提供并行配置建议和训练冒烟命令,未见恶意行为、凭据处理、隐蔽外传或破坏性默认值;权限范围相对克制,并提供 NVIDIA、Apache-2.0 和引用来源。扣分原因是执行验证命令会消耗 GPU/集群资源,未明确要求用户确认、未披露完整数据流,也未提供回滚或资源隔离方案。

可靠稳定8 / 20 · 2.0/5

内容结构基本一致,涵盖约束、公式、陷阱和失败条件;但依赖 uv、PyTorch、Megatron Bridge、CUDA 和特定 recipe,未在本文件中锁定版本或证明环境可用。虽有验证命令和成功标准,静态审查不能确认可运行性,且异常输入和诊断反馈较薄,因此不超过静态上限10并扣分。

适用触发10 / 15 · 3.3/5

名称、描述、when_to_use、模型规模/硬件/序列长度场景较明确,覆盖 dense 与 MoE,并说明若干非适用条件。扣分原因是多数 sizing 规则只是启发式,模型、GPU 显存、网络和版本边界不完整;文档为英文,未说明中文交互支持,且未专门证明中国大陆网络环境下的依赖可达性。

规范维护10 / 15 · 3.3/5

有 YAML 元数据、引用路径、已知约束/限制、验证步骤和 skill card;Apache-2.0 许可、NVIDIA 负责人及 v0.2.0rc6 信息可追溯。扣分原因是 SKILL.md 缺少 Instructions/Purpose,基准报告指出 author、tags 等推荐元数据缺失,未见明确 changelog、维护责任流程或稳定版本兼容矩阵。

有效结果7 / 15 · 2.3/5

技能直接给出 TP/PP/CP/EP/DP 公式、配置片段、拓扑规则、内存估算和 OOM/回归排查要点;提交的单个评测任务结果显示 Codex 正确性88%、有效性95%。扣分原因是仅有一个正向任务、没有负向触发覆盖,sizing 表被明确标为启发式,静态审查也不能验证输出在实际训练中直接可用,因此按上限取7。

证据核验5 / 10 · 2.5/5

存在代码锚点、仓库文档引用、card.yaml 的 code_verified/doc_only 标记、评测报告和固定 revision 上下文,具备一定审计线索。扣分原因是未提供可在本次静态审查中核验的实际日志、完整测试套件或多模型/多配置复现证据,且关键 sizing 指导主要仍是文档性主张,按静态上限取5。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 将验证命令视为会产生实际 GPU/分布式训练开销的操作,运行前应确认用户授权、GPU拓扑、world_size 可整除性、版本兼容性和资源配额。
  • 模型规模表和内存数字是启发式/示例,不应替代针对具体模型、精度、批大小、序列长度和通信网络的 profiling。
  • MoE 最小 GPU 公式及 DP/EDP 公式应结合实际 Megatron Bridge 版本和模型实现复核;当前材料缺少完整 EP+TP+PP+CP 的可复现实测证据。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

这是一个面向 NeMo MBridge 的分布式训练并行策略操作指南。它覆盖 TP、DP、PP、CP、EP 和 ETP 的选型、模型规模与硬件拓扑映射,以及组合配置。指南提供密集模型和 MoE 模型的起始规则、最小 GPU 数量公式、内存估算和验证配方。它适合需要配置或排查并行度、OOM 和性能回归的训练使用者,但建议将表格视为起点并通过首轮迭代进行 profiling。

根据模型规模、MoE 激活参数量、序列长度和 GPU 拓扑给出 TP/DP/PP/CP/EP/ETP 起始配置;提供 3D、4D 及 MoE 并行的 Python 配置示例;计算 dense 与 MoE 路径的数据并行规模和最小 GPU 数量;说明 TP、SP、CP、EP 与 PP 的常见配置错误;给出 70B FP16 模型的并行前后内存估算;提供使用 uv、PyTorch distributed 和 run_recipe.py 的 4 GPU 初始化验证命令及成功标准。

  1. NeMo MBridge 用户需要为 1B 至 500B 的密集模型估算 TP、PP 和 DP 起始值时。
  2. 训练 MoE 模型的工程师需要依据激活参数量和专家数量选择 EP、PP 与较小 TP 时。
  3. 多节点训练负责人需要将 TP 限制在单个 NVLink 域,并用 PP 或 DP 跨节点扩展时。
  4. 长上下文训练用户需要根据序列长度加入 SP 或 CP,并检查 CP 可整除条件时。
  5. 遇到 OOM、吞吐下降或并行配置变更回归的用户需要核对最小 GPU 数量和并行网格时。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖密集模型、MoE、长序列和不同网络拓扑的并行策略。
  • 明确给出最小 GPU 数量公式 PP × max(TP × CP, EP × ETP),并警告不要使用全维度乘积。
  • 包含可复制的 Megatron Bridge 配置片段、内存估算和 4 GPU 初始化验证配方。
  • 针对 SP、CP、EP、TP 跨节点和 pipeline bubble 列出具体陷阱。
局限
  • 模型规模表和示例是起始启发式规则,不是经过所有硬件和模型验证的保证。
  • SKILL.md 只提供一个最小 Llama 1B 验证配方,没有展示完整测试套件或广泛平台结果。
  • 没有在给定材料中说明具体软件版本、GPU 型号或环境兼容矩阵。
  • 验证命令依赖本地 Megatron Bridge 代码、CUDA、PyTorch distributed 和可用 GPU。

如何安装这个 Skill?

使用仓库 README 提供的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill nemo-mbridge-perf-parallelism-strategies --yes

CLI 会提示选择安装目标;README 未给出该单个技能的固定本地目录。

如何使用这个 Skill?

安装后,在加载该技能的 Agent 中提出具体并行配置问题,例如:"为 256 张 GPU 上的 DeepSeek-V3 671B 选择 TP、PP、EP、CP 和 DP,并计算最小 GPU 数量。" 也可以请求排查 OOM 或性能回归。涉及 MoE sizing 时,应提供 TP、PP、CP、EP、ETP 和 world size,以便使用指南中的公式。

常见问题

这个技能需要付费吗?
给定材料没有列出该技能的单独收费信息。仓库 README 说明可通过 npx skills CLI 安装;技能自身标注 Apache-2.0,仓库 README 声明项目采用 Apache 2.0 与 CC BY 4.0 双许可证。
它会自动找到正确的 GPU 配置吗?
不会提供保证性的自动配置结果。它给出按模型规模、拓扑和序列长度选择并行度的起始规则,并要求通过首轮迭代检查内存和通信表现。
MoE 最小 GPU 数量应如何计算?
使用 PP × max(TP × CP, EP × ETP),而不是 PP × TP × CP × EP × ETP;随后根据 world size 计算 dense DP 和 MoE EDP。
哪些配置错误最需要注意?
包括将 TP 跨越多个节点、在没有 TP 时启用 SP、使序列长度不满足 seq_length % (2 × CP) == 0,以及在密集模型上设置 EP。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 配方开发

帮助构建、修改和验证 NeMo AutoModel 训练与评估配方。

自动化与运维 ✓ NVIDIA · 官方

NeMo AutoModel 启动配置

为 NeMo AutoModel 配置交互式、多节点与云端任务启动。

相关 Skills