NeMo MBridge 并行策略指南
为 Megatron Bridge 训练选择、组合并核验并行策略。
技能仅提供并行配置建议和训练冒烟命令,未见恶意行为、凭据处理、隐蔽外传或破坏性默认值;权限范围相对克制,并提供 NVIDIA、Apache-2.0 和引用来源。扣分原因是执行验证命令会消耗 GPU/集群资源,未明确要求用户确认、未披露完整数据流,也未提供回滚或资源隔离方案。
内容结构基本一致,涵盖约束、公式、陷阱和失败条件;但依赖 uv、PyTorch、Megatron Bridge、CUDA 和特定 recipe,未在本文件中锁定版本或证明环境可用。虽有验证命令和成功标准,静态审查不能确认可运行性,且异常输入和诊断反馈较薄,因此不超过静态上限10并扣分。
名称、描述、when_to_use、模型规模/硬件/序列长度场景较明确,覆盖 dense 与 MoE,并说明若干非适用条件。扣分原因是多数 sizing 规则只是启发式,模型、GPU 显存、网络和版本边界不完整;文档为英文,未说明中文交互支持,且未专门证明中国大陆网络环境下的依赖可达性。
有 YAML 元数据、引用路径、已知约束/限制、验证步骤和 skill card;Apache-2.0 许可、NVIDIA 负责人及 v0.2.0rc6 信息可追溯。扣分原因是 SKILL.md 缺少 Instructions/Purpose,基准报告指出 author、tags 等推荐元数据缺失,未见明确 changelog、维护责任流程或稳定版本兼容矩阵。
技能直接给出 TP/PP/CP/EP/DP 公式、配置片段、拓扑规则、内存估算和 OOM/回归排查要点;提交的单个评测任务结果显示 Codex 正确性88%、有效性95%。扣分原因是仅有一个正向任务、没有负向触发覆盖,sizing 表被明确标为启发式,静态审查也不能验证输出在实际训练中直接可用,因此按上限取7。
存在代码锚点、仓库文档引用、card.yaml 的 code_verified/doc_only 标记、评测报告和固定 revision 上下文,具备一定审计线索。扣分原因是未提供可在本次静态审查中核验的实际日志、完整测试套件或多模型/多配置复现证据,且关键 sizing 指导主要仍是文档性主张,按静态上限取5。
- 将验证命令视为会产生实际 GPU/分布式训练开销的操作,运行前应确认用户授权、GPU拓扑、world_size 可整除性、版本兼容性和资源配额。
- 模型规模表和内存数字是启发式/示例,不应替代针对具体模型、精度、批大小、序列长度和通信网络的 profiling。
- MoE 最小 GPU 公式及 DP/EDP 公式应结合实际 Megatron Bridge 版本和模型实现复核;当前材料缺少完整 EP+TP+PP+CP 的可复现实测证据。
这个 Skill 能做什么,适合哪些场景?
这是一个面向 NeMo MBridge 的分布式训练并行策略操作指南。它覆盖 TP、DP、PP、CP、EP 和 ETP 的选型、模型规模与硬件拓扑映射,以及组合配置。指南提供密集模型和 MoE 模型的起始规则、最小 GPU 数量公式、内存估算和验证配方。它适合需要配置或排查并行度、OOM 和性能回归的训练使用者,但建议将表格视为起点并通过首轮迭代进行 profiling。
根据模型规模、MoE 激活参数量、序列长度和 GPU 拓扑给出 TP/DP/PP/CP/EP/ETP 起始配置;提供 3D、4D 及 MoE 并行的 Python 配置示例;计算 dense 与 MoE 路径的数据并行规模和最小 GPU 数量;说明 TP、SP、CP、EP 与 PP 的常见配置错误;给出 70B FP16 模型的并行前后内存估算;提供使用 uv、PyTorch distributed 和 run_recipe.py 的 4 GPU 初始化验证命令及成功标准。
- NeMo MBridge 用户需要为 1B 至 500B 的密集模型估算 TP、PP 和 DP 起始值时。
- 训练 MoE 模型的工程师需要依据激活参数量和专家数量选择 EP、PP 与较小 TP 时。
- 多节点训练负责人需要将 TP 限制在单个 NVLink 域,并用 PP 或 DP 跨节点扩展时。
- 长上下文训练用户需要根据序列长度加入 SP 或 CP,并检查 CP 可整除条件时。
- 遇到 OOM、吞吐下降或并行配置变更回归的用户需要核对最小 GPU 数量和并行网格时。
这个 Skill 有哪些优点和局限?
- 覆盖密集模型、MoE、长序列和不同网络拓扑的并行策略。
- 明确给出最小 GPU 数量公式 PP × max(TP × CP, EP × ETP),并警告不要使用全维度乘积。
- 包含可复制的 Megatron Bridge 配置片段、内存估算和 4 GPU 初始化验证配方。
- 针对 SP、CP、EP、TP 跨节点和 pipeline bubble 列出具体陷阱。
- 模型规模表和示例是起始启发式规则,不是经过所有硬件和模型验证的保证。
- SKILL.md 只提供一个最小 Llama 1B 验证配方,没有展示完整测试套件或广泛平台结果。
- 没有在给定材料中说明具体软件版本、GPU 型号或环境兼容矩阵。
- 验证命令依赖本地 Megatron Bridge 代码、CUDA、PyTorch distributed 和可用 GPU。
如何安装这个 Skill?
使用仓库 README 提供的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill nemo-mbridge-perf-parallelism-strategies --yes
CLI 会提示选择安装目标;README 未给出该单个技能的固定本地目录。
如何使用这个 Skill?
安装后,在加载该技能的 Agent 中提出具体并行配置问题,例如:"为 256 张 GPU 上的 DeepSeek-V3 671B 选择 TP、PP、EP、CP 和 DP,并计算最小 GPU 数量。" 也可以请求排查 OOM 或性能回归。涉及 MoE sizing 时,应提供 TP、PP、CP、EP、ETP 和 world size,以便使用指南中的公式。