开发与工程 ✓ NVIDIA · 官方 cuda-graphsmegatron-bridgetransformer-enginedistributed-trainingmixture-of-expertsgpu-performance

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

FollowSkills 评估 · FSRS-2.0
不推荐
55/ 100 五分制 2.8 / 5
信任安全16 / 25 · 3.2/5

技能明确披露了静态形状、内存占用、NCCL 环境、CPU offloading、重计算、MoE 范围和 packed sequence 等风险,也提供了图清理和基准比较建议;未见恶意行为、凭据处理或越权访问。扣分原因是缺少明确的用户确认门槛、通用回滚方案和失败时的恢复流程,且 local full_iteration 路径要求关闭 NaN 检查,安全边界仍需操作者自行把关。

可靠稳定9 / 20 · 2.3/5

内容结构基本一致,配置约束、代码锚点、常见失败模式和测试命令较完整,并说明了捕获与 replay 的区别。扣分原因是本次为静态审查,测试和功能 smoke test 未执行;依赖的 Megatron-Core、Transformer Engine、容器、GPU 架构和后端组合较复杂,部分异常路径仍只给出断言或简要修复建议。按静态校准不超过 10 分。

适用触发10 / 15 · 3.3/5

目标用户、CUDA graph 实现、作用域选择、MoE 与 dense 场景、适用条件和不适用条件较清楚;不依赖海外在线服务,未发现中国大陆网络可达性方面的核心阻碍。扣分原因是内容面向英文 NVIDIA/Megatron 环境,未提供中文说明;对具体版本、容器和硬件环境的适配边界仍有限,语义触发主要依赖配置关键词。

规范维护9 / 15 · 3.0/5

SKILL.md 采用了决策、启用示例、约束、代码锚点、陷阱和验证的渐进结构,并配有 card.yaml、BENCHMARK.md、评测任务和版本信息;技能声明 Apache-2.0,仓库也提供许可证与维护发布工作流。扣分原因是评测发现缺少推荐的 Instructions 和 Examples 小节、元数据未指定作者,更新日志和明确维护责任/更新路径不足;题定许可证元数据为 NOASSERTION,也降低了治理清晰度。

有效结果7 / 15 · 2.3/5

技能能直接产出 Megatron Bridge 的 CUDA graph 配置建议,覆盖 dense、MoE、full-iteration、TE scoped graph 以及 steady-state timing 比较,且文件记录了若干实测成功、变慢、阻塞和 OOM 案例。扣分原因是收益高度依赖 workload,部分效果证据不可在本次静态审查中复现,输出仍需结合目标容器、GPU、dispatcher 和显存余量进行人工验证。按静态校准最高 7 分。

证据核验4 / 10 · 2.0/5

文件提供了配置源码行号、训练循环锚点、MCore 类名、测试文件、评测记录和若干测量结果,具备一定审计线索;同时明确指出部分端到端测试未执行、loss 结论不充分和后续验证需求。扣分原因是缺少本次审查可独立复现的执行结果,证据主要来自技能随附报告和代码引用,交叉 corroboration 覆盖有限。按静态校准最高 5 分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要把技能中记录的 15–25% step-time 或 20–33% throughput 提升视为保证;应在目标 GPU、容器、dispatcher、batch shape 和显存配置上排除 warmup/capture 后重新测量。
  • local + full_iteration 需要关闭 loss NaN 检查,并且 CUDA graph 会固定中间 buffer;启用前应确认监控、显存余量和中止/清理流程。
  • TE scoped graphs 与 packed sequences、full recompute、CPU offloading、动态序列长度及部分 TE attention backend 组合可能直接失败。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 NeMo MBridge 和 Megatron Bridge 进行大规模模型训练的工程师,指导 CUDA Graph 的配置、捕获、回放与验证。它涵盖 MCore 的本地全迭代图,以及 Transformer Engine 针对注意力、MLP 和 MoE 模块的作用域图。内容包括配置示例、性能测试命令、代码锚点、约束条件、常见故障和单元测试与 GPU 冒烟测试。它适合需要降低主机端开销的训练工作负载,但成功捕获并不保证实际加速。

指导用户设置 cuda_graph_impl、cuda_graph_scope、预热步数和 TE RNG tracker;通过性能 harness 运行训练配置;解释 local full_iteration 与 transformer_engine 作用域图的捕获流程;检查静态张量形状、MoE 作用域、重计算、延迟权重梯度和 NCCL 内存注册等约束;运行针对 CUDA Graph 配置和通信重叠的 pytest 单元测试,以及需要 GPU 的功能冒烟测试;根据预热后的 eager 与图回放迭代比较性能。

  1. 训练稠密模型的工程师,希望先对 attention、再对 MLP 使用 TE 作用域图以降低主机驱动开销。
  2. 训练 dropless MoE 模型的工程师,需要配置 attn、moe_router 和 moe_preprocess 图作用域。
  3. 调试 CUDA Graph 配置变更导致的训练崩溃、断言或性能回归。
  4. 使用选择性重计算的训练工作负载,需要评估其与 TE 作用域图的组合。
  5. 需要全前向加反向迭代捕获,并能够满足更严格约束的训练工程师。

这个 Skill 有哪些优点和局限?

优点
  • 同时覆盖 local full_iteration 和 Transformer Engine 作用域图两种实现。
  • 提供可复制的 Python 配置、性能 harness CLI 和 pytest 验证命令。
  • 明确说明 RNG tracker、静态形状、MoE、重计算、CPU offloading 和 NCCL 注册等关键约束。
  • 包含代码锚点、正向 recipe 示例和图清理逻辑,便于定位实现细节。
局限
  • CUDA Graph 会固定中间缓冲区,可能显著增加显存;全迭代图的峰值显存可能达到原来的 1.5–2 倍。
  • 动态或变长序列、CPU offloading 和部分 MoE/重计算组合不兼容。
  • 功能冒烟测试需要 GPU;文档没有提供跨硬件平台的完整测试矩阵。
  • 文档中的成功捕获案例回放速度略慢于 eager,不能将捕获成功视为性能提升保证。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装指定技能:

npx skills add nvidia/skills --skill nemo-mbridge-perf-cuda-graphs --yes

README 未说明该技能在每种客户端中的具体安装目录;CLI 会提示或处理安装目标。

如何使用这个 Skill?

在已加载该技能的 Agent 中提出与 Megatron Bridge CUDA Graph 配置或性能验证相关的请求,例如:“为我的 Megatron Bridge dropless MoE 训练配置 transformer_engine CUDA Graph,并验证 warmup 后的 replay 性能。”根据模型类型选择 attn、mlp 或 MoE 作用域;固定 sequence length 和 micro-batch size,先稳定 eager 运行,再执行图捕获和回放比较。

这个 Skill 与同类方案有什么区别?

该技能明确比较 eager 执行与 CUDA Graph 回放,并在 local 全迭代图与 Transformer Engine 作用域图之间提供选择建议。它建议多数训练工作负载先尝试 TE 作用域图,只有需要全迭代捕获且能满足更严格限制时才使用 local full_iteration。

常见问题

这个技能适合所有训练任务吗?
不适合。它主要针对 Megatron Bridge 训练中主机驱动开销明显、张量形状静态且能够满足 CUDA Graph 约束的任务。
使用 CUDA Graph 是否一定会加速?
不一定。技能要求在预热和捕获后,将图回放迭代与同一 dispatcher、布局和容器下的 eager 基线比较。
为什么配置了 CUDA Graph 后会触发断言?
常见原因包括未启用 use_te_rng_tracker 和 rng.te_rng_tracker、full_iteration 未关闭 loss NaN 检查、作用域组合非法、使用 CPU offloading,或重计算配置与 TE 作用域不兼容。
需要什么验证环境?
单元测试使用 uv、Python 和 pytest;功能测试明确需要 GPU,并应检查训练完成且日志中没有 NCCL 错误或非法内存访问。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

MoE 分发器选型指南

根据硬件、专家并行规模和优化阶段选择 alltoall、DeepEP 或 HybridEP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

MoE 硬件配置参考

为不同 NVIDIA 平台提供 MoE 训练配置与吞吐规划参考。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

相关 Skills