NeMo MBridge 分层上下文并行
帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。
技能仅指导配置和日志检查,未见恶意行为、凭据处理或隐蔽外传;明确了MPU路径、TE版本和进程组限制。因缺少执行前确认、回滚方案、权限边界和数据流说明,且许可证元数据为NOASSERTION,扣分。
配置约束、常见陷阱和失败日志信号描述较一致,并提供可诊断的断言与日志判据。静态审查无法确认命令可运行;没有专门的Bridge端到端测试,异常环境和依赖失败反馈不足,故不超过静态上限并扣分。
目标用户、触发词、CP=4示例及MPU-only边界较清楚,也说明了不适用的去中心化PG路径。缺少更广泛输入边界、模型族适配和中文使用说明;对中国大陆网络没有明确评估,但核心功能不依赖海外在线服务,未作额外重大扣分。
SKILL.md结构清晰,含启用配置、代码锚点、实现图、陷阱和验证;card.yaml补充限制、证据和后续工作。缺少Instructions、Examples、author/tags、明确维护责任、变更记录和稳定版本策略,评测文件也记录了这些缺项。
对“给出配置、约束、TE要求和日志证明”的核心任务直接有用,且评测文件显示有限的正确性和有效性结果。只有一个正向任务,没有Bridge HCP端到端训练验证,实际结果正确性和相对手工方案的收益仍需人工复核,因此按静态上限保守计分。
提供Megatron-Core/Bridge代码路径、断言、日志判据、验证状态和评测任务,关键主张具备一定追溯性。证据主要是仓库内材料,缺少独立复现、真实覆盖HCP关键路径的测试和多来源交叉验证,因此不超过静态上限。
- 不要将去中心化PG路径用于期望启用HCP的配置;当前描述称该路径只创建扁平CP组。
- 执行前确认Transformer Engine版本、层级尺寸乘积和序列长度整除条件,并核对日志出现HIERARCHICAL_CONTEXT_PARALLEL_GROUPS。
- 当前没有已提交的Bridge HCP端到端训练测试或正式示例,生产使用前应补充验证和回滚方案。
- 评测报告和skill-card包含发布评估信息,但不能替代独立复现;许可证元数据仍标为NOASSERTION。
这个 Skill 能做什么,适合哪些场景?
该技能面向需要在 Megatron-Bridge 中扩展上下文并行的工程师。它说明如何使用 cp_comm_type="a2a+p2p" 和 hierarchical_context_parallel_sizes 配置嵌套上下文并行进程组。内容涵盖配置约束、Megatron-Core 与 Bridge 的代码锚点、Transformer Engine 集成、常见故障和日志验证方法。当前 Bridge 的分层上下文并行路径仅支持 MPU,且没有专用的端到端测试。
提供最小 Bridge 配置示例,解释 context_parallel_size、cp_comm_type、hierarchical_context_parallel_sizes 和 use_decentralized_pg 的关系;指出 Megatron-Core 配置验证、Bridge 进程组初始化和 Transformer Engine 注意力集成的代码位置;说明产品约束、旧版本静默失效风险以及如何通过日志确认 HIERARCHICAL_CONTEXT_PARALLEL_GROUPS 已创建;提供 decentralized-PG 单元测试命令和 4-GPU 手动冒烟命令。
- Megatron-Bridge 工程师需要将上下文并行扩展到 KV heads 之外,并配置多级并行组。
- 分布式训练人员因修改 CP 配置遇到 OOM 或性能回归,需要定位配置和初始化路径。
- 维护人员使用 a2a+p2p 时,需要确认 hierarchical_context_parallel_sizes 的乘积与 context_parallel_size 一致。
- 测试人员需要通过单元测试、4-GPU运行和日志检查验证 HCP 是否真正启用。
这个 Skill 有哪些优点和局限?
- 给出可直接套用的 Bridge 配置和验证命令。
- 明确列出乘积约束、序列长度约束和 Transformer Engine 版本要求。
- 包含代码锚点、旧版本静默失效风险以及日志级故障判断。
- Bridge 当前仅通过 MPU 支持 HCP;启用 decentralized PG 时 HCP 未设置。
- 目前没有专用的 Bridge HCP 端到端测试或已签入的 Bridge 配方。
- 单 GPU 加载辅助函数会清除 hierarchical_context_parallel_sizes。
- 手动冒烟检查要求 4 张 GPU,且技能没有提供更广泛平台覆盖的证据。
如何安装这个 Skill?
使用仓库 README 中的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill nemo-mbridge-perf-hierarchical-context-parallel --yes
README 未说明该技能的独立手动复制目录或其他专用安装步骤。
如何使用这个 Skill?
向兼容的 Agent Skills 客户端提出与 Megatron-Bridge 分层上下文并行相关的配置、OOM、回归或验证任务。手动验证时,可运行:
CUDA_VISIBLE_DEVICES=0,1,2,3 uv run python -m torch.distributed.run --nproc_per_node=4 \
scripts/training/run_recipe.py \
--recipe llama32_1b_pretrain_config \
model.context_parallel_size=4 \
model.cp_comm_type=a2a+p2p \
"model.hierarchical_context_parallel_sizes=[2,2]" \
train.train_iters=2
检查日志是否创建 HIERARCHICAL_CONTEXT_PARALLEL_GROUPS,并确认训练至少完成一步;若只出现 CONTEXT_PARALLEL_GROUP,则 HCP 未启用。
这个 Skill 与同类方案有什么区别?
技能明确提到 a2a+p2p、纯 a2a 和 p2p 三种上下文并行通信方案,并指向相应决策树;但未提供完整的性能对比数据。