开发与工程 ✓ NVIDIA · 官方 megatron-lmmegatron-bridgedistributed-traininggpu-trainingloss-correlationmixed-precision

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

FollowSkills 评估 · FSRS-2.0
不推荐
44/ 100 五分制 2.2 / 5
信任安全10 / 25 · 2.0/5

技能明确限定训练入口、环境变量和不得修改的第三方目录,也说明无外部凭据需求;但包含未经确认的 rm -rf nemo_experiments,缺少备份、回滚和数据流说明,对真实数据及训练产物的影响边界也不完整,因此扣分。

可靠稳定8 / 20 · 2.0/5

SKILL.md 提供了单 GPU、多 GPU、调度器、PYTHONPATH、OOM 和子模块切换等具体路径及常见故障提示;但本次仅静态阅读,技能自身没有配套测试套件或 CI 覆盖关键训练路径,异常输入和失败诊断仍有限,且静态上限为 10 分,因此未给高分。

适用触发9 / 15 · 3.0/5

目标用户、相关触发语句、MLM 与 Bridge 对比、相关性测试和多 GPU 场景较清楚,并披露了参数映射和 MoE 限制;但非适用边界、硬件与版本前置条件、中文支持及中国大陆网络环境适配未说明,触发精度证据也只有一个正向任务,因此扣分。

规范维护8 / 15 · 2.7/5

技能有 front matter、Apache-2.0 声明、示例命令、recipes、陷阱、限制和 skill card;但缺少推荐的 Instructions/Examples 章节、作者字段,版本与变更记录不在主技能文件中,维护责任和更新路径不够明确,且静态验证发现 schema 缺项,因此扣分。

有效结果6 / 15 · 2.0/5

命令和参数较具体,能够覆盖相关性 smoke test、常用 recipe 及多 GPU 示例;BENCHMARK 报告一个正向任务取得通过且结果较好,但覆盖极窄、没有真实执行证据可在本次静态审查中独立确认,输出仍需用户结合本地依赖和硬件调整,因此未接近满分。

证据核验3 / 10 · 1.5/5

文件列出了证据文件、验证状态、评估任务和结果,并披露了待补充的 CI 相关性测试;但没有技能专属的已提交测试套件或真实 CI 复现链,报告主要是单任务、单次评估,关键结论的独立交叉验证不足,因此仅给有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应确认 nemo_experiments 仅包含可删除的旧实验,并先备份或采用可恢复清理方式。
  • 文档未固定 CUDA、PyTorch、Megatron-Core、Megatron-LM 与 Bridge 的兼容版本;真实训练前需自行核对环境。
  • 不要将真实敏感数据直接用于 mock/相关性示例,也不要把训练日志或配置中的凭据提交到输出或仓库。
  • 评估证据仅覆盖一个正向 smoke 任务,不能证明多 GPU、真实数据、翻译脚本边界或失败路径均可用。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 NeMo MBridge、Megatron-LM 和 Megatron Bridge 进行语言模型训练的开发者。它提供模拟数据或真实数据训练指导、MLM 与 Bridge 的损失相关性测试、常用训练配方和多 GPU 示例。内容还涵盖命令行参数到 Bridge 配置的映射、Megatron-Core 子模块切换以及常见故障排查。它适合需要复现实验、比较训练结果或定位提交后损失曲线分歧的场景。

指导用户运行 MLM 的 pretrain_gpt.py 和 Bridge 的 scripts/training/run_recipe.py,使用 vanilla_gpt_pretrain_config 进行匹配配置的相关性测试;给出单 GPU 与 2 GPU、TP=2 的命令示例;说明如何比较日志中的 lm loss、切换 Megatron-Core 版本、重新同步子模块,并处理旧检查点、PYTHONPATH、调度器覆盖和 MoE 显存等问题。

  1. 需要验证 Megatron-LM 与 Megatron Bridge 在相同 BF16 配置下损失是否一致的训练工程师。
  2. 想用模拟数据快速运行 GPT 训练相关性测试的研究人员。
  3. 需要将 MLM CLI 参数转换为 Bridge 配置的 NeMo MBridge 用户。
  4. 发现某次代码提交后损失曲线分叉、需要按检查清单排查原因的开发者。
  5. 需要在 2 GPU、TP=2 配置下测试训练流程的工程团队。

这个 Skill 有哪些优点和局限?

优点
  • 提供可直接执行的单 GPU 和多 GPU 训练命令。
  • 明确列出 Bridge 配方、入口脚本、启动方式和新运行清理要求。
  • 覆盖相关性验证、常用配方、Megatron-Core 版本切换和典型故障。
  • 针对 BF16 损失比较给出明确的验证标准。
局限
  • 内容聚焦 Megatron-LM 与 Megatron Bridge,不是通用分布式训练指南。
  • 示例主要使用小规模配置和模拟数据;真实数据、具体硬件及多节点部署覆盖有限。
  • SKILL.md 未提供独立测试套件或平台兼容性矩阵。
  • 仓库元数据标为 `NOASSERTION`,但该技能自身声明 Apache-2.0;授权信息需按使用场景进一步核对。

如何安装这个 Skill?

使用 NVIDIA 技能目录安装:npx skills add nvidia/skills --skill nemo-mbridge-mlm-bridge-training --agent codex --yes。README 未说明该命令之外的单独安装步骤;安装后,技能会在代理下一次加载技能并遇到相关任务时可用。

如何使用这个 Skill?

可向代理提问:如何运行 MLM 与 Bridge 的 correlation test?如何比较 MLM vs Bridge 的 loss curves?为什么提交后 loss curves diverged?。执行训练时使用 uv run python -m torch.distributed.run;MLM 命令需设置 PYTHONPATH=3rdparty/Megatron-LM:$PYTHONPATH,Bridge 新一轮相关性测试前删除 nemo_experiments

这个 Skill 与同类方案有什么区别?

该技能直接比较 Megatron-LM(MLM)与 Megatron Bridge 的训练入口、配置和损失曲线,适合评估两者在匹配参数下的行为一致性。

常见问题

这个技能适合谁?
适合运行 NeMo MBridge、Megatron-LM 或 Megatron Bridge 训练,并需要验证损失一致性的开发者和研究人员。
是否必须使用真实数据?
不必须;技能提供 `--mock-data` 的 MLM 相关性示例,但 Bridge 示例未显式设置该参数。
为什么 Bridge 训练前要删除 `nemo_experiments`?
因为 Bridge 可能静默从旧检查点自动恢复,导致新一轮相关性测试受到陈旧状态影响。
切换到 Megatron-Core dev 后还能使用锁文件同步吗?
技能说明 `uv sync --locked` 会因锁文件对应 main 提交而失败,应改用不带 `--locked` 的 `uv sync`。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

自动化与运维 ✓ NVIDIA · 官方

NeMo MBridge 多节点 Slurm 助手

将单节点 MBridge 脚本转换为多节点 Slurm 作业,并诊断启动、NCCL 与 MoE 显存问题。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

相关 Skills