开发与工程 ✓ NVIDIA · 官方 nemo-automodeldistributed-trainingfsdp2tensor-parallelismpipeline-parallelismcontext-parallelismexpert-parallelism

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

FollowSkills 评估 · FSRS-2.0
不推荐
58/ 100 五分制 2.9 / 5
信任安全18 / 25 · 3.6/5

技能仅提供分布式训练配置建议,未见凭据获取、数据外传、破坏性默认操作或过度权限;同时明确不应在提示、日志和输出中包含秘密。扣分原因是未定义用户确认、回滚方案、数据流边界或依赖安全审查,且许可证信息在技能元数据与仓库级NOASSERTION之间存在治理不确定性。

可靠稳定9 / 20 · 2.3/5

内容结构一致,覆盖策略选择、约束、常见陷阱和验证命令,并包含3个正向评测任务及其结果。扣分原因是本次仅静态阅读,未执行关键路径;依赖版本、异常输入行为、失败诊断和实际命令输出不足,且SKILL.md超过静态检查的500行限制。

适用触发10 / 15 · 3.3/5

目标用户、触发场景、策略边界和主要配置字段描述清楚,明确区分FSDP2、MegatronFSDP与DDP的能力。扣分原因是非适用范围和语义触发条件仍不完整,缺乏中文示例或本土环境适配说明;核心功能依赖NeMo、PyTorch、CUDA/NCCL及多GPU基础设施。

规范维护9 / 15 · 3.0/5

具备YAML与Python示例、目录式代码锚点、已知陷阱、许可证、作者、版本和评测卡片;仓库说明每日同步并提供更新入口。扣分原因是文档过长、作者格式被静态检查标为不合规,未提供明确的变更日志、依赖版本、维护责任人联系路径或系统化FAQ。

有效结果7 / 15 · 2.3/5

技能直接给出策略、YAML字段、尺寸约束和不支持的组合,评测文件覆盖TP/PP、MoE EP和MegatronFSDP限制,且记录了较高的任务正确率与有效性。静态校准将分数限制为7;未执行代表性配方,实际模型兼容性、性能收益和输出可直接运行程度仍需人工复核。

证据核验5 / 10 · 2.5/5

存在固定修订版本、代码路径锚点、评测任务、预期行为和基准报告,支持有限的审计与复核。扣分原因是没有提交测试套件或CI覆盖该技能关键路径,基准结果本身未提供可独立重现的执行工件,且缺少多来源交叉验证。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 将建议用于真实多GPU或多节点训练前,应在目标NeMo AutoModel、PyTorch、CUDA/NCCL和模型版本上执行最小配方,并核对实际MeshContext、模型_pp_plan及并行尺寸约束。
  • 不要把BENCHMARK.md中的评测百分比视为独立验证;该文件未提供可复现的运行日志、环境锁定或测试工件。
  • 技能文档存在长度和作者格式静态检查问题,且许可证治理信息需在发布前统一确认。
  • 在中国大陆网络或受限环境中,NeMo及相关模型、容器和依赖获取可能受可达性、镜像和许可影响。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导 NeMo AutoModel 中 FSDP2、MegatronFSDP 和 DDP 的选择与配置。它覆盖张量、流水线、上下文、专家及混合分片数据并行,并说明网格大小与硬件拓扑约束。技能提供 YAML 配置模式、Python API 示例、常见限制和验证标准。它适合需要调试多 GPU 或多节点训练问题的开发者,但不覆盖模型接入、启动器、Slurm、SkyPilot 或检查点流程。

根据分布式训练问题推荐 distributed.strategy,生成相关的最小 YAML 字段或 Python 配置示例,计算并说明 dp_sizeep_sizecp_sizetp_sizepp_size 的约束,解释 MeshContext、流水线、上下文并行和 MoE 专家并行的配置方式,并指出 MegatronFSDP 与 DDP 不支持的并行策略。

  1. NeMo AutoModel 开发者需要在单节点多 GPU 上选择默认的 FSDP2 或简单 DDP。
  2. 大模型训练者需要为 70B 以上模型配置 TP 与 PP,并处理跨节点扩展。
  3. MoE 模型开发者需要启用专家并行并验证 `ep_size` 对数据与上下文并行规模的整除约束。
  4. 长序列训练者需要为 8K 以上序列添加上下文并行并检查注意力后端兼容性。
  5. 遇到多 GPU 或多节点失败的工程师需要检查并行策略、设备网格和 sizing 约束。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 FSDP2、MegatronFSDP 和 DDP 的明确选型逻辑。
  • 提供 TP、PP、CP、EP、HSDP、序列打包和激活检查点的具体配置示例。
  • 明确列出设备拓扑、并行规模和兼容性限制。
  • 同时提供 YAML recipe 与 Python API 配置路径。
局限
  • 仅提供配置指导,不执行训练或自动验证配置。
  • 源材料没有给出自动化测试套件、支持平台矩阵或性能基准。
  • 范围明确排除模型接入、启动流程、Slurm、SkyPilot 和检查点指导。

如何安装这个 Skill?

使用 NVIDIA 技能集合中的默认 CLI 安装:npx skills add nvidia/skills --skill nemo-automodel-distributed-training --yes。CLI 会提示安装目标;源材料未说明具体本地目录布局或其他客户端的专用安装步骤。

如何使用这个 Skill?

安装后,在相关任务中向 Agent 提问,例如:为一个 70B NeMo AutoModel 配置 FSDP2、TP=8、PP=4,并说明 dp_size 约束,或 为 MoE 模型配置专家并行,检查 ep_size 的限制。技能会先给出策略,再列出相关 YAML 字段、约束和不支持的策略。

这个 Skill 与同类方案有什么区别?

技能将 FSDP2、MegatronFSDP 和 DDP 作为直接选项比较:FSDP2 是通用默认方案并支持 TP、PP、CP、EP 和 HSDP;MegatronFSDP 不支持 PP、EP 或 sequence_parallel;DDP 仅适合简单数据并行。

常见问题

安装或使用该技能是否收费?
源材料未说明费用、商业许可或运行成本;仓库 README 说明集合采用 Apache 2.0 与 CC BY 4.0 双许可证,而该 SKILL.md 标注 Apache-2.0。
为什么启用 PP、EP 或 sequence_parallel 时不能选 MegatronFSDP?
该技能明确说明 MegatronFSDP 不支持流水线并行、专家并行或 `sequence_parallel`,这些场景应使用 FSDP2。
配置 MoE 专家并行时最重要的失败条件是什么?
`ep_size` 必须整除 `dp_size * cp_size`;此外,专家并行使用 FSDP2,并创建独立的 `moe_mesh`。
启用流水线并行前需要检查什么?
模型类必须定义 `_pp_plan`,并设置 `pp_size > 1` 及包含调度器和 microbatch 大小的 `pipeline` 子配置。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 配方开发

帮助构建、修改和验证 NeMo AutoModel 训练与评估配方。

自动化与运维 ✓ NVIDIA · 官方

NeMo AutoModel 启动配置

为 NeMo AutoModel 配置交互式、多节点与云端任务启动。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

MoE 分发器选型指南

根据硬件、专家并行规模和优化阶段选择 alltoall、DeepEP 或 HybridEP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

相关 Skills