开发与工程 ✓ NVIDIA · 官方 megatron-bridgehierarchical-context-parallelcontext-parallelismdistributed-trainingtransformer-enginecudapytest

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

FollowSkills 评估 · FSRS-2.0
不推荐
51/ 100 五分制 2.6 / 5
信任安全15 / 25 · 3.0/5

技能仅指导配置和日志检查,未见恶意行为、凭据处理或隐蔽外传;明确了MPU路径、TE版本和进程组限制。因缺少执行前确认、回滚方案、权限边界和数据流说明,且许可证元数据为NOASSERTION,扣分。

可靠稳定8 / 20 · 2.0/5

配置约束、常见陷阱和失败日志信号描述较一致,并提供可诊断的断言与日志判据。静态审查无法确认命令可运行;没有专门的Bridge端到端测试,异常环境和依赖失败反馈不足,故不超过静态上限并扣分。

适用触发10 / 15 · 3.3/5

目标用户、触发词、CP=4示例及MPU-only边界较清楚,也说明了不适用的去中心化PG路径。缺少更广泛输入边界、模型族适配和中文使用说明;对中国大陆网络没有明确评估,但核心功能不依赖海外在线服务,未作额外重大扣分。

规范维护9 / 15 · 3.0/5

SKILL.md结构清晰,含启用配置、代码锚点、实现图、陷阱和验证;card.yaml补充限制、证据和后续工作。缺少Instructions、Examples、author/tags、明确维护责任、变更记录和稳定版本策略,评测文件也记录了这些缺项。

有效结果5 / 15 · 1.7/5

对“给出配置、约束、TE要求和日志证明”的核心任务直接有用,且评测文件显示有限的正确性和有效性结果。只有一个正向任务,没有Bridge HCP端到端训练验证,实际结果正确性和相对手工方案的收益仍需人工复核,因此按静态上限保守计分。

证据核验4 / 10 · 2.0/5

提供Megatron-Core/Bridge代码路径、断言、日志判据、验证状态和评测任务,关键主张具备一定追溯性。证据主要是仓库内材料,缺少独立复现、真实覆盖HCP关键路径的测试和多来源交叉验证,因此不超过静态上限。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要将去中心化PG路径用于期望启用HCP的配置;当前描述称该路径只创建扁平CP组。
  • 执行前确认Transformer Engine版本、层级尺寸乘积和序列长度整除条件,并核对日志出现HIERARCHICAL_CONTEXT_PARALLEL_GROUPS。
  • 当前没有已提交的Bridge HCP端到端训练测试或正式示例,生产使用前应补充验证和回滚方案。
  • 评测报告和skill-card包含发布评估信息,但不能替代独立复现;许可证元数据仍标为NOASSERTION。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向需要在 Megatron-Bridge 中扩展上下文并行的工程师。它说明如何使用 cp_comm_type="a2a+p2p" 和 hierarchical_context_parallel_sizes 配置嵌套上下文并行进程组。内容涵盖配置约束、Megatron-Core 与 Bridge 的代码锚点、Transformer Engine 集成、常见故障和日志验证方法。当前 Bridge 的分层上下文并行路径仅支持 MPU,且没有专用的端到端测试。

提供最小 Bridge 配置示例,解释 context_parallel_size、cp_comm_type、hierarchical_context_parallel_sizes 和 use_decentralized_pg 的关系;指出 Megatron-Core 配置验证、Bridge 进程组初始化和 Transformer Engine 注意力集成的代码位置;说明产品约束、旧版本静默失效风险以及如何通过日志确认 HIERARCHICAL_CONTEXT_PARALLEL_GROUPS 已创建;提供 decentralized-PG 单元测试命令和 4-GPU 手动冒烟命令。

  1. Megatron-Bridge 工程师需要将上下文并行扩展到 KV heads 之外,并配置多级并行组。
  2. 分布式训练人员因修改 CP 配置遇到 OOM 或性能回归,需要定位配置和初始化路径。
  3. 维护人员使用 a2a+p2p 时,需要确认 hierarchical_context_parallel_sizes 的乘积与 context_parallel_size 一致。
  4. 测试人员需要通过单元测试、4-GPU运行和日志检查验证 HCP 是否真正启用。

这个 Skill 有哪些优点和局限?

优点
  • 给出可直接套用的 Bridge 配置和验证命令。
  • 明确列出乘积约束、序列长度约束和 Transformer Engine 版本要求。
  • 包含代码锚点、旧版本静默失效风险以及日志级故障判断。
局限
  • Bridge 当前仅通过 MPU 支持 HCP;启用 decentralized PG 时 HCP 未设置。
  • 目前没有专用的 Bridge HCP 端到端测试或已签入的 Bridge 配方。
  • 单 GPU 加载辅助函数会清除 hierarchical_context_parallel_sizes。
  • 手动冒烟检查要求 4 张 GPU,且技能没有提供更广泛平台覆盖的证据。

如何安装这个 Skill?

使用仓库 README 中的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill nemo-mbridge-perf-hierarchical-context-parallel --yes

README 未说明该技能的独立手动复制目录或其他专用安装步骤。

如何使用这个 Skill?

向兼容的 Agent Skills 客户端提出与 Megatron-Bridge 分层上下文并行相关的配置、OOM、回归或验证任务。手动验证时,可运行:

CUDA_VISIBLE_DEVICES=0,1,2,3 uv run python -m torch.distributed.run --nproc_per_node=4 \
scripts/training/run_recipe.py \
--recipe llama32_1b_pretrain_config \
model.context_parallel_size=4 \
model.cp_comm_type=a2a+p2p \
"model.hierarchical_context_parallel_sizes=[2,2]" \
train.train_iters=2

检查日志是否创建 HIERARCHICAL_CONTEXT_PARALLEL_GROUPS,并确认训练至少完成一步;若只出现 CONTEXT_PARALLEL_GROUP,则 HCP 未启用。

这个 Skill 与同类方案有什么区别?

技能明确提到 a2a+p2p、纯 a2a 和 p2p 三种上下文并行通信方案,并指向相应决策树;但未提供完整的性能对比数据。

常见问题

使用 a2a+p2p 时必须配置什么?
必须设置 hierarchical_context_parallel_sizes,且其乘积必须等于 context_parallel_size;此外需要 Transformer Engine >= 1.12.0。
为什么配置正确后仍看不到 HCP?
如果 use_decentralized_pg=True,Bridge 当前只初始化扁平 CP 组并将 HCP 置空。还应检查日志是否出现 HIERARCHICAL_CONTEXT_PARALLEL_GROUPS。
这个技能是否包含完整自动化测试?
没有专用的 Bridge HCP 端到端测试;文档建议使用现有单元测试和日志检查,并执行手动冒烟运行。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 长上下文训练

为 Megatron Bridge 的长上下文 MoE 训练提供并行配置、重计算与性能调优建议。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 序列打包

为 Megatron-Bridge 配置并验证序列打包与长上下文训练。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE VLM 训练指南

帮助选择并调优 MoE 视觉语言模型的 FSDP 与 3D 并行训练方案。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 通信重叠调优

优化 Megatron Bridge 中 MoE 专家并行通信与计算重叠。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

cuPyNumeric 迁移就绪度评估

在投入大规模移植工作前,判断 NumPy 代码能否在 GPU 和多 GPU 环境中有效扩展。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 配方开发

帮助构建、修改和验证 NeMo AutoModel 训练与评估配方。

相关 Skills