开发与工程 ✓ NVIDIA · 官方 megatron-bridgetraining-recipesdistributed-trainingmodel-parallelismfine-tuningpretraininggpu-configuration

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

FollowSkills 评估 · FSRS-2.0
不推荐
53/ 100 五分制 2.7 / 5
信任安全16 / 25 · 3.2/5

技能明确区分生产训练与 mock 性能基准,要求用户提供模型、GPU、目标和序列长度,且未要求凭据或秘密;但执行命令可能产生高成本外部训练效果,缺少明确的执行确认、权限边界、回滚方案和配置安全验证,因此扣分。

可靠稳定8 / 20 · 2.0/5

文档提供了索引、入口、调整规则和常见故障提示,路径相对一致;但本次仅静态阅读,未执行关键命令,缺少针对该技能的测试套件,且部分兼容性和扩展规则仍需环境验证,因此按静态上限保守评分并扣分。

适用触发11 / 15 · 3.7/5

目标用户、输入字段、训练模式、GPU规模和长上下文场景较清楚,且包含 PEFT、VLM、MoE 和 diffusion 范围;未声明充分的非适用边界、中文使用支持或不同软件版本差异,故扣分。

规范维护8 / 15 · 2.7/5

SKILL.md 结构可读,包含元数据、依赖入口、示例、限制和版本化索引;但 BENCHMARK 报告指出缺少推荐的 Instructions 和 Examples 分节,作者元数据缺失,维护责任、变更记录和更新路径也不够明确,因此扣分。

有效结果6 / 15 · 2.0/5

技能能直接给出 recipe 函数、启动命令、数据集和并行度调整建议;BENCHMARK 仅报告一次正向任务且未在本次审查中执行,输出仍需用户根据实际硬件、版本和数据验证,因此未超过静态上限并扣分。

证据核验4 / 10 · 2.0/5

存在固定修订、评测报告、单个正向评测任务及明确 ground truth,可审计部分关键主张;但没有该技能专属的提交测试套件或多任务独立复现证据,且本次未执行,因此证据覆盖有限。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要把性能 recipe 当作生产训练配置;其使用 mock 数据且文档称吞吐目标未经收敛验证。
  • 执行前应核对 Megatron Bridge 版本、模型实际配置、GPU 拓扑、num_key_value_heads、CP 通信类型和数据集;文档中的并行度建议不是运行保证。
  • 建议补充明确的执行确认、失败诊断、版本兼容矩阵、维护联系人和多场景评测。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能帮助用户为预训练、监督微调或参数高效微调选择 NeMo MBridge 训练配方。它根据模型名称或规模、GPU数量与类型、训练目标和序列长度匹配库内配方,并给出入口命令。技能还提供张量、流水线、上下文和专家并行的调整规则,以及批大小和常见故障建议。它同时区分用于实际训练的库配方与仅用于吞吐量基准测试的性能配方。

询问模型名称或规模、GPU数量与类型、训练目标及非默认序列长度;查找匹配的库配方或性能配方;输出配方函数名和训练入口命令;建议如何调整TP、PP、CP、EP、SP、数据并行和批大小;提示TP与KV头数、长上下文、MoE、CUDA Graph、FSDP及多模态数据的常见问题。

  1. 正在首次试用 Megatron Bridge、希望用模拟数据完成冒烟测试的用户。
  2. 需要为 Llama、Qwen、DeepSeek、Nemotron 或其他已列出模型选择预训练配方的训练工程师。
  3. 希望在有限GPU上进行SFT或PEFT,并需要调整并行配置的用户。
  4. 计划进行16K至128K长上下文训练、需要选择上下文并行配方的用户。
  5. 只想测量H100、B系列或GB系列GPU吞吐上限、明确使用模拟数据基准的用户。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖预训练、SFT和PEFT,并提供多个模型家族、VLM和扩散模型配方。
  • 明确区分生产训练配方与模拟数据吞吐量基准配方。
  • 包含TP、PP、CP、EP、SP、批大小和OOM处理等具体调整规则。
  • 提供可直接复制的训练和性能基准命令示例。
局限
  • 推荐范围受SKILL.md中已列出的配方限制;没有精确匹配时只能使用相近规模并调整配置。
  • 性能配方默认使用模拟数据和50次迭代,不能作为生产收敛配置。
  • 实际运行依赖Python、uv、PyTorch和Megatron Bridge环境;该技能未提供完整环境安装说明。
  • 不同GPU互联、模型结构和并行组合可能导致兼容性或性能问题,需要用户验证。

如何安装这个 Skill?

使用仓库README提供的 skills CLI:npx skills add nvidia/skills --skill nemo-mbridge-recipe-recommender --yes。README说明无需克隆仓库或手动复制技能目录;技能将在代理下次加载相关技能时可用。

如何使用这个 Skill?

向代理说明模型名称或规模、GPU数量和类型、训练目标(pretrain、SFT或PEFT)以及非默认序列长度,例如:“为8张H100上的Llama 3 8B选择SFT起始配方”。代理应先区分库配方和性能配方,再给出配方函数名、入口命令、数据集选择和并行度调整建议。

这个 Skill 与同类方案有什么区别?

技能将功能性库配方与性能配方作为两类明确替代方案:前者通过scripts/training/run_recipe.py用于训练,后者通过scripts/performance/run_script.py进行模拟数据吞吐量基准。

常见问题

它适合单GPU训练吗?
决策树指出单GPU通常使用TP=1、PP=1的PEFT配方;示例包括llama3_8b_peft_config或qwen3_8b_peft_config。
性能配方能直接用于生产训练吗?
不能直接这样理解。性能配方用于上限吞吐量基准,默认运行50次模拟数据迭代,吞吐量目标不代表经过验证的收敛配置。
GPU数量与配方默认值不同时怎么办?
技能会建议调整并行度和批大小;TP必须整除num_key_value_heads,TP大于1时启用SP,长上下文配置CP,并在OOM时优先降低micro_batch_size。
安装或运行是否需要付费服务或MCP?
来源没有提到付费服务或MCP要求;安装命令使用skills CLI,运行配方则依赖本地训练环境。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

数据与分析 ✓ NVIDIA · 官方

Nemotron 模型定制流水线

为 Nemotron 模型规划、配置并串联数据处理、训练、对齐、转换、优化与评测步骤。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 配方开发

帮助构建、修改和验证 NeMo AutoModel 训练与评估配方。

相关 Skills