MoE 硬件配置参考
为不同 NVIDIA 平台提供 MoE 训练配置与吞吐规划参考。
内容主要是只读配置参考,没有凭据处理、隐蔽外传、恶意代码或破坏性默认操作;提供了容器、路由、精度和环境变量风险提示,并明确不要照搬 tracker 行。扣分原因是没有明确的用户确认、执行隔离、回滚流程、权限边界或数据流说明;环境变量和训练配置可能对外部训练作业产生实际影响。
SKILL.md 结构清晰,包含平台表、配置族、环境变量和陷阱说明,异常输入提示也较少。扣分原因是关键路径没有可执行脚本、依赖检查、复现步骤或失败反馈;Qwen3 235B GB200 的 VPP=unspecified 与 card.yaml 中 VPP12 存在实质冲突。静态校准将分数限制在10以下。
触发条件、目标用户、硬件平台、模型族和主要输出内容较明确,且说明了不应外推 VPP。扣分原因是非适用范围、输入要求和触发排除条件不完整;未提供中文使用支持证据。其核心功能不依赖海外在线服务,但文档可达性和本地环境适配仍未验证。
具备名称、描述、Apache-2.0 许可证、所有者、版本信息、已知限制、验证日期和更新变化提示。扣分原因是缺少推荐的 metadata.author、metadata.tags、Instructions、Examples 等结构,安装/依赖、FAQ、故障排查和明确维护责任/更新路径不足;benchmark 还报告了 card.yaml 的电话号码 PII 检查项。
对选择 H100、B200、GB200、GB300 上的 MoE 并行配置具有直接参考价值,包含代表性布局、调优方向和性能区间,并明确禁止把未测量 VPP=12 当作结论。扣分原因是输出仍需结合目标软件栈、容器、路由和实测结果复核;性能收益与代表性配置主要是点时测量,单个评测任务不足以证明广泛效果。静态校准不超过7。
文件列出了若干内部性能 tracker 名称、验证日期、测量状态和一项评测报告,提供了有限审计线索。扣分原因是没有提交可复现实验、测试套件或直接证据内容,只有一个正向任务且无负向任务;配置文件与技能正文存在 VPP 冲突,关键性能声明无法仅凭这些文件独立核验。静态校准不超过5。
- card.yaml 的 Qwen3 235B GB200 条目写有 VPP12,而 SKILL.md 要求 VPP=unspecified;使用前必须以目标版本的实测数据解决冲突。
- 性能区间和收益是点时、栈相关的测量,不应直接作为承诺或生产配置;应核对模型、精度、容器、Megatron/TE 版本、路由和 PP/VPP 平衡。
- benchmark 仅包含一个正向任务,且静态审查未执行训练、配置或测试路径;不能视为独立复现证据。
- 评测报告指出 card.yaml 存在国际电话号码 PII 检查项,发布前应审查并清理不必要的个人信息。
这个 Skill 能做什么,适合哪些场景?
该技能面向需要在 H100、B200、GB200 或 GB300 上规划 MoE 训练的工程师。它按硬件平台和模型族整理通信调度器、张量/专家/流水线并行布局、精度、重计算与 CUDA Graph 建议。内容还提供经过四舍五入的吞吐和 MFU 区间,用于规划而非精确承诺。它强调通信重叠、流水线布局、CPU 调优、容器质量和内存余量等跨平台因素。
根据硬件和工作负载给出代表性 MoE 配置;列出 DeepEP 或 HybridEP、TP、EP、PP、VPP、精度和重计算组合;提供 DSV3、Qwen3 235B、Qwen3 30B 与 Qwen3-Next 80B 的吞吐规划区间;说明 CUDA Graph 范围、CUDA_DEVICE_MAX_CONNECTIONS、PYTORCH_CUDA_ALLOC_CONF 和 NCCL_GRAPH_REGISTER 的常见设置;总结 GB200/GB300 的 CPU 侧调优重点与配置选择陷阱。该技能提供参考信息,不执行训练或基准测试。
- 负责 H100 集群训练 DSV3 的工程师,需要选择 DeepEP、TP=2、EP=64、PP=8、VPP=4 等起始布局。
- 负责 B200 部署的团队,需要评估 MXFP8、DeepEP、PP 布局和通信调优对 DSV3 的影响。
- 在 GB200 或 GB300 上运行 DSV3 的工程师,需要采用 HybridEP、CPU 调优和图友好静态形状。
- 在 H100 或 GB200 上规划 Qwen3 235B 训练的团队,需要比较并行布局和预期吞吐区间。
- 遇到 MoE 内存压力的训练工程师,需要选择 moe_act、mlp、norm 或更强的选择性重计算策略。
这个 Skill 有哪些优点和局限?
- 覆盖 H100、B200、GB200 和 GB300,并给出可直接作为起点的并行布局。
- 同时提供配置组合、吞吐规划区间、环境变量和 CPU 侧调优提示。
- 明确警告不要直接照搬 tracker 行,强调路由、容器和 PP 布局的影响。
- 对 GB200 上 Qwen3 235B 的 VPP 不确定性给出明确约束。
- 吞吐区间经过四舍五入,不能替代目标环境中的实测基准。
- 覆盖的模型和平台有限,未提供其他硬件或模型的配置。
- GB200 上 Qwen3 235B 的 VPP 明确未指定,无法从该技能得到完整布局。
- 内容是参考 playbook,不包含训练启动、部署或自动调参命令。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill nemo-mbridge-perf-moe-hardware-configs --yes
README 未说明该命令的具体安装目录;CLI 会处理安装目标。
如何使用这个 Skill?
安装后,在相关 Agent 中提出具体硬件或模型问题,例如:“Give me an MoE hardware playbook for Qwen3 235B on GB200, including parallelism, CUDA Graph scopes, environment variables, and throughput caveats.” 对 GB200 上的 Qwen3 235B,要求明确保留 VPP=unspecified,除非有实测数据。