NeMo AutoModel 分布式训练配置
为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。
技能仅提供分布式训练配置建议,未见凭据获取、数据外传、破坏性默认操作或过度权限;同时明确不应在提示、日志和输出中包含秘密。扣分原因是未定义用户确认、回滚方案、数据流边界或依赖安全审查,且许可证信息在技能元数据与仓库级NOASSERTION之间存在治理不确定性。
内容结构一致,覆盖策略选择、约束、常见陷阱和验证命令,并包含3个正向评测任务及其结果。扣分原因是本次仅静态阅读,未执行关键路径;依赖版本、异常输入行为、失败诊断和实际命令输出不足,且SKILL.md超过静态检查的500行限制。
目标用户、触发场景、策略边界和主要配置字段描述清楚,明确区分FSDP2、MegatronFSDP与DDP的能力。扣分原因是非适用范围和语义触发条件仍不完整,缺乏中文示例或本土环境适配说明;核心功能依赖NeMo、PyTorch、CUDA/NCCL及多GPU基础设施。
具备YAML与Python示例、目录式代码锚点、已知陷阱、许可证、作者、版本和评测卡片;仓库说明每日同步并提供更新入口。扣分原因是文档过长、作者格式被静态检查标为不合规,未提供明确的变更日志、依赖版本、维护责任人联系路径或系统化FAQ。
技能直接给出策略、YAML字段、尺寸约束和不支持的组合,评测文件覆盖TP/PP、MoE EP和MegatronFSDP限制,且记录了较高的任务正确率与有效性。静态校准将分数限制为7;未执行代表性配方,实际模型兼容性、性能收益和输出可直接运行程度仍需人工复核。
存在固定修订版本、代码路径锚点、评测任务、预期行为和基准报告,支持有限的审计与复核。扣分原因是没有提交测试套件或CI覆盖该技能关键路径,基准结果本身未提供可独立重现的执行工件,且缺少多来源交叉验证。
- 将建议用于真实多GPU或多节点训练前,应在目标NeMo AutoModel、PyTorch、CUDA/NCCL和模型版本上执行最小配方,并核对实际MeshContext、模型_pp_plan及并行尺寸约束。
- 不要把BENCHMARK.md中的评测百分比视为独立验证;该文件未提供可复现的运行日志、环境锁定或测试工件。
- 技能文档存在长度和作者格式静态检查问题,且许可证治理信息需在发布前统一确认。
- 在中国大陆网络或受限环境中,NeMo及相关模型、容器和依赖获取可能受可达性、镜像和许可影响。
这个 Skill 能做什么,适合哪些场景?
该技能指导 NeMo AutoModel 中 FSDP2、MegatronFSDP 和 DDP 的选择与配置。它覆盖张量、流水线、上下文、专家及混合分片数据并行,并说明网格大小与硬件拓扑约束。技能提供 YAML 配置模式、Python API 示例、常见限制和验证标准。它适合需要调试多 GPU 或多节点训练问题的开发者,但不覆盖模型接入、启动器、Slurm、SkyPilot 或检查点流程。
根据分布式训练问题推荐 distributed.strategy,生成相关的最小 YAML 字段或 Python 配置示例,计算并说明 dp_size、ep_size、cp_size、tp_size 和 pp_size 的约束,解释 MeshContext、流水线、上下文并行和 MoE 专家并行的配置方式,并指出 MegatronFSDP 与 DDP 不支持的并行策略。
- NeMo AutoModel 开发者需要在单节点多 GPU 上选择默认的 FSDP2 或简单 DDP。
- 大模型训练者需要为 70B 以上模型配置 TP 与 PP,并处理跨节点扩展。
- MoE 模型开发者需要启用专家并行并验证 `ep_size` 对数据与上下文并行规模的整除约束。
- 长序列训练者需要为 8K 以上序列添加上下文并行并检查注意力后端兼容性。
- 遇到多 GPU 或多节点失败的工程师需要检查并行策略、设备网格和 sizing 约束。
这个 Skill 有哪些优点和局限?
- 覆盖 FSDP2、MegatronFSDP 和 DDP 的明确选型逻辑。
- 提供 TP、PP、CP、EP、HSDP、序列打包和激活检查点的具体配置示例。
- 明确列出设备拓扑、并行规模和兼容性限制。
- 同时提供 YAML recipe 与 Python API 配置路径。
- 仅提供配置指导,不执行训练或自动验证配置。
- 源材料没有给出自动化测试套件、支持平台矩阵或性能基准。
- 范围明确排除模型接入、启动流程、Slurm、SkyPilot 和检查点指导。
如何安装这个 Skill?
使用 NVIDIA 技能集合中的默认 CLI 安装:npx skills add nvidia/skills --skill nemo-automodel-distributed-training --yes。CLI 会提示安装目标;源材料未说明具体本地目录布局或其他客户端的专用安装步骤。
如何使用这个 Skill?
安装后,在相关任务中向 Agent 提问,例如:为一个 70B NeMo AutoModel 配置 FSDP2、TP=8、PP=4,并说明 dp_size 约束,或 为 MoE 模型配置专家并行,检查 ep_size 的限制。技能会先给出策略,再列出相关 YAML 字段、约束和不支持的策略。
这个 Skill 与同类方案有什么区别?
技能将 FSDP2、MegatronFSDP 和 DDP 作为直接选项比较:FSDP2 是通用默认方案并支持 TP、PP、CP、EP 和 HSDP;MegatronFSDP 不支持 PP、EP 或 sequence_parallel;DDP 仅适合简单数据并行。