开发与工程 ✓ NVIDIA · 官方 moe-traininggpu-performanceparallelismnemo-mbridgemegatron-coreh100gb200

MoE 硬件配置参考

为不同 NVIDIA 平台提供 MoE 训练配置与吞吐规划参考。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全17 / 25 · 3.4/5

内容主要是只读配置参考,没有凭据处理、隐蔽外传、恶意代码或破坏性默认操作;提供了容器、路由、精度和环境变量风险提示,并明确不要照搬 tracker 行。扣分原因是没有明确的用户确认、执行隔离、回滚流程、权限边界或数据流说明;环境变量和训练配置可能对外部训练作业产生实际影响。

可靠稳定7 / 20 · 1.8/5

SKILL.md 结构清晰,包含平台表、配置族、环境变量和陷阱说明,异常输入提示也较少。扣分原因是关键路径没有可执行脚本、依赖检查、复现步骤或失败反馈;Qwen3 235B GB200 的 VPP=unspecified 与 card.yaml 中 VPP12 存在实质冲突。静态校准将分数限制在10以下。

适用触发10 / 15 · 3.3/5

触发条件、目标用户、硬件平台、模型族和主要输出内容较明确,且说明了不应外推 VPP。扣分原因是非适用范围、输入要求和触发排除条件不完整;未提供中文使用支持证据。其核心功能不依赖海外在线服务,但文档可达性和本地环境适配仍未验证。

规范维护8 / 15 · 2.7/5

具备名称、描述、Apache-2.0 许可证、所有者、版本信息、已知限制、验证日期和更新变化提示。扣分原因是缺少推荐的 metadata.author、metadata.tags、Instructions、Examples 等结构,安装/依赖、FAQ、故障排查和明确维护责任/更新路径不足;benchmark 还报告了 card.yaml 的电话号码 PII 检查项。

有效结果6 / 15 · 2.0/5

对选择 H100、B200、GB200、GB300 上的 MoE 并行配置具有直接参考价值,包含代表性布局、调优方向和性能区间,并明确禁止把未测量 VPP=12 当作结论。扣分原因是输出仍需结合目标软件栈、容器、路由和实测结果复核;性能收益与代表性配置主要是点时测量,单个评测任务不足以证明广泛效果。静态校准不超过7。

证据核验4 / 10 · 2.0/5

文件列出了若干内部性能 tracker 名称、验证日期、测量状态和一项评测报告,提供了有限审计线索。扣分原因是没有提交可复现实验、测试套件或直接证据内容,只有一个正向任务且无负向任务;配置文件与技能正文存在 VPP 冲突,关键性能声明无法仅凭这些文件独立核验。静态校准不超过5。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • card.yaml 的 Qwen3 235B GB200 条目写有 VPP12,而 SKILL.md 要求 VPP=unspecified;使用前必须以目标版本的实测数据解决冲突。
  • 性能区间和收益是点时、栈相关的测量,不应直接作为承诺或生产配置;应核对模型、精度、容器、Megatron/TE 版本、路由和 PP/VPP 平衡。
  • benchmark 仅包含一个正向任务,且静态审查未执行训练、配置或测试路径;不能视为独立复现证据。
  • 评测报告指出 card.yaml 存在国际电话号码 PII 检查项,发布前应审查并清理不必要的个人信息。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向需要在 H100、B200、GB200 或 GB300 上规划 MoE 训练的工程师。它按硬件平台和模型族整理通信调度器、张量/专家/流水线并行布局、精度、重计算与 CUDA Graph 建议。内容还提供经过四舍五入的吞吐和 MFU 区间,用于规划而非精确承诺。它强调通信重叠、流水线布局、CPU 调优、容器质量和内存余量等跨平台因素。

根据硬件和工作负载给出代表性 MoE 配置;列出 DeepEP 或 HybridEP、TP、EP、PP、VPP、精度和重计算组合;提供 DSV3、Qwen3 235B、Qwen3 30B 与 Qwen3-Next 80B 的吞吐规划区间;说明 CUDA Graph 范围、CUDA_DEVICE_MAX_CONNECTIONS、PYTORCH_CUDA_ALLOC_CONF 和 NCCL_GRAPH_REGISTER 的常见设置;总结 GB200/GB300 的 CPU 侧调优重点与配置选择陷阱。该技能提供参考信息,不执行训练或基准测试。

  1. 负责 H100 集群训练 DSV3 的工程师,需要选择 DeepEP、TP=2、EP=64、PP=8、VPP=4 等起始布局。
  2. 负责 B200 部署的团队,需要评估 MXFP8、DeepEP、PP 布局和通信调优对 DSV3 的影响。
  3. 在 GB200 或 GB300 上运行 DSV3 的工程师,需要采用 HybridEP、CPU 调优和图友好静态形状。
  4. 在 H100 或 GB200 上规划 Qwen3 235B 训练的团队,需要比较并行布局和预期吞吐区间。
  5. 遇到 MoE 内存压力的训练工程师,需要选择 moe_act、mlp、norm 或更强的选择性重计算策略。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 H100、B200、GB200 和 GB300,并给出可直接作为起点的并行布局。
  • 同时提供配置组合、吞吐规划区间、环境变量和 CPU 侧调优提示。
  • 明确警告不要直接照搬 tracker 行,强调路由、容器和 PP 布局的影响。
  • 对 GB200 上 Qwen3 235B 的 VPP 不确定性给出明确约束。
局限
  • 吞吐区间经过四舍五入,不能替代目标环境中的实测基准。
  • 覆盖的模型和平台有限,未提供其他硬件或模型的配置。
  • GB200 上 Qwen3 235B 的 VPP 明确未指定,无法从该技能得到完整布局。
  • 内容是参考 playbook,不包含训练启动、部署或自动调参命令。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill nemo-mbridge-perf-moe-hardware-configs --yes

README 未说明该命令的具体安装目录;CLI 会处理安装目标。

如何使用这个 Skill?

安装后,在相关 Agent 中提出具体硬件或模型问题,例如:“Give me an MoE hardware playbook for Qwen3 235B on GB200, including parallelism, CUDA Graph scopes, environment variables, and throughput caveats.” 对 GB200 上的 Qwen3 235B,要求明确保留 VPP=unspecified,除非有实测数据。

常见问题

安装或使用该技能需要付费吗?
源材料没有说明费用、订阅或授权成本;仓库描述的该技能许可证为 Apache-2.0,仓库整体为 Apache-2.0 与 CC BY 4.0 双许可证。
它会自动运行训练或测量吞吐吗?
不会。它提供配置建议和四舍五入的规划区间;源材料没有给出执行训练或基准测试的脚本。
为什么不能直接复制某个 tracker 配置?
因为结果还取决于路由模式、容器质量、PP 布局、VPP 平衡和精度。技能明确建议比较绝对吞吐,并固定路由模式。
它适合哪些问题?
适合硬件特定的 MoE playbook、吞吐估算以及 H100、B200、GB200、GB300 上的并行策略问题;不适合通用训练启动或完整部署流程。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

MoE 分发器选型指南

根据硬件、专家并行规模和优化阶段选择 alltoall、DeepEP 或 HybridEP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

Megatron-Core 测试指南

帮助你在 Megatron-Core 中设计、运行并复现分布式测试。

开发与工程 ✓ NVIDIA · 官方

Megatron-Core 代码检查与格式化

帮助 Megatron-LM 开发者运行统一的 Python 检查与格式化流程。

自动化与运维 ✓ NVIDIA · 官方

Megatron-Core CI 故障转 Issue

调查失败的 GitHub Actions 任务,并为 NVIDIA Megatron-LM 创建结构化缺陷 Issue。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo-RL 自动研究助手

将 NeMo-RL 研究目标转化为可复现的迭代实验。

相关 Skills