开发与工程 ✓ NVIDIA · 官方 fault-tolerancestraggler-detectionin-process-restartpreemptioncheckpointingmegatron-bridgedistributed-training

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

FollowSkills 评估 · FSRS-2.0
不推荐
57/ 100 五分制 2.9 / 5
信任安全17 / 25 · 3.4/5

技能明确限定 Slurm、ft_launcher、环境变量和不兼容组合,并未要求凭据、秘密或外部数据传输;但涉及分布式作业重启、终止训练、信号处理和检查点写入,缺少执行前确认、最小权限说明、数据流披露及明确回滚方案,因此扣分。

可靠稳定8 / 20 · 2.0/5

配置示例、参数表、陷阱、代码锚点和验证命令较完整,且说明了 torchrun、NCCL watchdog、异步检查点等关键失败条件;但本次仅静态阅读,依赖版本和运行环境约束未完全复现,错误输出与异常输入处理说明有限,因此按静态上限保守扣分。

适用触发11 / 15 · 3.7/5

目标用户、触发词、Slurm fault tolerance、straggler、preemption、restart 和 checkpoint 场景清楚,也声明了多项不兼容和实验性边界;但未定义更多非适用范围,未提供中文指导,且对不同集群、版本和非 Slurm 环境的适配证据有限,因此扣分。

规范维护10 / 15 · 3.3/5

文档按功能、配置、陷阱、代码锚点和验证组织,包含依赖约束、示例、限制、版本信息和 NVIDIA 归属;但缺少推荐的 Instructions/Examples 章节、metadata.author/tags,维护更新路径和变更记录不充分,且许可证元数据显示 NOASSERTION 与局部 Apache/仓库双许可证信息存在治理不一致,因此扣分。

有效结果7 / 15 · 2.3/5

技能覆盖故障容错、慢卡检测、抢占、进程内重启、重跑状态机及检查点恢复,并给出可直接改写的 Python、shell 配置和验证入口;但未在本次审查中执行,基准仅为单个正向任务且部分效率/发现性指标有限,复杂环境中的直接可用性仍需人工验证,因此按静态上限计分。

证据核验4 / 10 · 2.0/5

代码路径、测试路径、示例路径和验证命令提供了可审计线索,BENCHMARK.md 还记录了有限评估结果;但 card.yaml 的验证主要是 file_existence_only,基准覆盖仅一个任务,缺少独立第三方复现和真实端到端恢复证据,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行会影响分布式训练作业,尤其是自动重启、stop_if_detected、信号处理和检查点写入;应先人工确认集群权限、检查点可恢复性和终止策略。
  • 直接 FaultToleranceConfig 必须使用 ft_launcher;IPR 与 NeMo-Run/Slurm preemption 不兼容,且需要匹配的 PyTorch/NCCL 版本和环境变量。
  • 文档中的验证主要是路径存在性、示例命令和单任务基准,不能替代目标集群上的端到端故障恢复测试。
  • 未提供中文说明;核心运行功能不是完全依赖海外在线服务,但依赖包、文档或镜像获取可能受网络和版本可达性影响。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能为 NeMo MBridge(Megatron Bridge)提供分布式训练韧性配置与排障指导。它覆盖 Slurm 环境中的容错、GPU 失速检测、抢占处理、进程内重启和实验性的重运行状态机,并补充异步及本地检查点配置。内容包含 Python 配置、启动命令、环境变量、代码锚点、常见陷阱和验证方式。它适合需要减少训练因节点故障、GPU 失速或进程挂起而中断的 Megatron Bridge 用户,但部分功能依赖特定 PyTorch/NCCL 版本或运行环境。

指导用户通过 FaultTolerancePlugin 或 FaultToleranceConfig 配置故障容错和分段超时,使用 ft_launcher 启动任务并设置 GROUP_RANK;配置 NVRxStragglerDetectionConfig 生成 GPU 相对及单卡性能报告;配置 Slurm 抢占插件或 SIGTERM 退出处理;设置实验性的重运行状态机以检查 NaN 和尖峰损失;配置 InProcessRestartConfig、必要的 NCCL/PyTorch 环境变量和直接 srun 启动方式;启用 torch_dist 格式的异步检查点保存及 NVRx 本地检查点;提供 pytest、示例脚本和日志关键字用于验证。

  1. 负责 Slurm 多节点训练的工程师希望在 rank 心跳超时或故障后自动重启任务。
  2. 排查训练偶发挂起或单个 GPU 性能下降的用户需要启用 NVRx 失速检测并查看各 rank 分数。
  3. 运行受限时长 Slurm 作业的用户需要在作业结束前接收信号并保存可恢复状态。
  4. 希望从节点或 rank 故障中恢复而无需完全退出训练的用户需要评估进程内重启。
  5. 需要让训练继续运行同时写入检查点的用户可以配置异步检查点保存。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖容错、失速检测、抢占、进程内重启和检查点等多个训练恢复环节。
  • 提供可复制的 Python 配置、Shell 启动命令、参数默认值和验证命令。
  • 明确列出 ft_launcher、NCCL watchdog 和异步检查点等容易出错的配置关系。
  • 提供配置、运行时代码、测试和示例的代码锚点,便于继续排查。
局限
  • 故障容错和抢占部分标明为 Slurm 场景;进程内重启不支持 NeMo-Run 或 Slurm Executor。
  • 进程内重启要求兼容的 PyTorch/NCCL 版本,并要求设置特定环境变量。
  • 重运行状态机仍属 alpha,完整重运行工作流不应被视为稳定能力。
  • SKILL.md 没有给出具体版本矩阵、硬件覆盖范围或完整端到端测试结果。

如何安装这个 Skill?

从 NVIDIA/skills 集合安装此技能:

npx skills add nvidia/skills --skill nemo-mbridge-resiliency --yes

也可以指定 Codex:

npx skills add nvidia/skills --skill nemo-mbridge-resiliency --agent codex --yes

README 未说明单独手动复制后的具体目录规则;它说明技能加载后,代理遇到相关任务即可使用。

如何使用这个 Skill?

在已加载技能的代理中提出明确任务,例如:“为我的 Megatron Bridge Slurm 训练启用故障容错、NVRx 失速检测和抢占处理,并检查启动命令是否正确。”随后根据环境选择 NeMo Run 插件或 FaultToleranceConfig;直接配置故障容错时使用 ft_launcher 而不是 torchrun。启用进程内重启时设置文档列出的环境变量,并直接使用 srun --kill-on-bad-exit=0;验证时运行对应示例或 pytest 命令并检查指定日志。

这个 Skill 与同类方案有什么区别?

相较于直接使用 torchrun,FaultToleranceConfig 的启动方式要求使用 ft_launcher,否则故障容错可能被静默禁用。相较于 NeMo Run FaultTolerancePlugin,直接配置方式需要手动设置 FaultToleranceConfig、启动器和环境变量;进程内重启则不能与 NeMo-Run 或 Slurm 抢占插件组合使用。NVRx 失速检测也应与旧版失速检测二选一。

常见问题

这个技能是否需要 Slurm?
故障容错和抢占示例明确面向 Slurm;非 Slurm 场景可按文档使用 ft_launcher,并设置 GROUP_RANK=0。进程内重启要求直接使用 srun,但不支持 NeMo-Run 的 Slurm Executor。
为什么不能用 torchrun 启动故障容错?
SKILL.md 明确要求直接 FaultToleranceConfig 配合 ft_launcher;使用 torchrun 会静默禁用故障容错。
异步检查点有哪些限制?
async_save=True 只有在 ckpt_format="torch_dist" 时才有效;其他格式可能静默失败或报错。
NVRx 检测到失速 GPU 后会自动停止训练吗?
不会默认停止。stop_if_detected 默认是 False;需要自动终止时应设置为 True。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 配方开发

帮助构建、修改和验证 NeMo AutoModel 训练与评估配方。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

自动化与运维 ✓ NVIDIA · 官方

NeMo AutoModel 启动配置

为 NeMo AutoModel 配置交互式、多节点与云端任务启动。

相关 Skills