NeMo MBridge 配方推荐器
根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。
技能明确区分生产训练与 mock 性能基准,要求用户提供模型、GPU、目标和序列长度,且未要求凭据或秘密;但执行命令可能产生高成本外部训练效果,缺少明确的执行确认、权限边界、回滚方案和配置安全验证,因此扣分。
文档提供了索引、入口、调整规则和常见故障提示,路径相对一致;但本次仅静态阅读,未执行关键命令,缺少针对该技能的测试套件,且部分兼容性和扩展规则仍需环境验证,因此按静态上限保守评分并扣分。
目标用户、输入字段、训练模式、GPU规模和长上下文场景较清楚,且包含 PEFT、VLM、MoE 和 diffusion 范围;未声明充分的非适用边界、中文使用支持或不同软件版本差异,故扣分。
SKILL.md 结构可读,包含元数据、依赖入口、示例、限制和版本化索引;但 BENCHMARK 报告指出缺少推荐的 Instructions 和 Examples 分节,作者元数据缺失,维护责任、变更记录和更新路径也不够明确,因此扣分。
技能能直接给出 recipe 函数、启动命令、数据集和并行度调整建议;BENCHMARK 仅报告一次正向任务且未在本次审查中执行,输出仍需用户根据实际硬件、版本和数据验证,因此未超过静态上限并扣分。
存在固定修订、评测报告、单个正向评测任务及明确 ground truth,可审计部分关键主张;但没有该技能专属的提交测试套件或多任务独立复现证据,且本次未执行,因此证据覆盖有限。
- 不要把性能 recipe 当作生产训练配置;其使用 mock 数据且文档称吞吐目标未经收敛验证。
- 执行前应核对 Megatron Bridge 版本、模型实际配置、GPU 拓扑、num_key_value_heads、CP 通信类型和数据集;文档中的并行度建议不是运行保证。
- 建议补充明确的执行确认、失败诊断、版本兼容矩阵、维护联系人和多场景评测。
这个 Skill 能做什么,适合哪些场景?
该技能帮助用户为预训练、监督微调或参数高效微调选择 NeMo MBridge 训练配方。它根据模型名称或规模、GPU数量与类型、训练目标和序列长度匹配库内配方,并给出入口命令。技能还提供张量、流水线、上下文和专家并行的调整规则,以及批大小和常见故障建议。它同时区分用于实际训练的库配方与仅用于吞吐量基准测试的性能配方。
询问模型名称或规模、GPU数量与类型、训练目标及非默认序列长度;查找匹配的库配方或性能配方;输出配方函数名和训练入口命令;建议如何调整TP、PP、CP、EP、SP、数据并行和批大小;提示TP与KV头数、长上下文、MoE、CUDA Graph、FSDP及多模态数据的常见问题。
- 正在首次试用 Megatron Bridge、希望用模拟数据完成冒烟测试的用户。
- 需要为 Llama、Qwen、DeepSeek、Nemotron 或其他已列出模型选择预训练配方的训练工程师。
- 希望在有限GPU上进行SFT或PEFT,并需要调整并行配置的用户。
- 计划进行16K至128K长上下文训练、需要选择上下文并行配方的用户。
- 只想测量H100、B系列或GB系列GPU吞吐上限、明确使用模拟数据基准的用户。
这个 Skill 有哪些优点和局限?
- 覆盖预训练、SFT和PEFT,并提供多个模型家族、VLM和扩散模型配方。
- 明确区分生产训练配方与模拟数据吞吐量基准配方。
- 包含TP、PP、CP、EP、SP、批大小和OOM处理等具体调整规则。
- 提供可直接复制的训练和性能基准命令示例。
- 推荐范围受SKILL.md中已列出的配方限制;没有精确匹配时只能使用相近规模并调整配置。
- 性能配方默认使用模拟数据和50次迭代,不能作为生产收敛配置。
- 实际运行依赖Python、uv、PyTorch和Megatron Bridge环境;该技能未提供完整环境安装说明。
- 不同GPU互联、模型结构和并行组合可能导致兼容性或性能问题,需要用户验证。
如何安装这个 Skill?
使用仓库README提供的 skills CLI:npx skills add nvidia/skills --skill nemo-mbridge-recipe-recommender --yes。README说明无需克隆仓库或手动复制技能目录;技能将在代理下次加载相关技能时可用。
如何使用这个 Skill?
向代理说明模型名称或规模、GPU数量和类型、训练目标(pretrain、SFT或PEFT)以及非默认序列长度,例如:“为8张H100上的Llama 3 8B选择SFT起始配方”。代理应先区分库配方和性能配方,再给出配方函数名、入口命令、数据集选择和并行度调整建议。
这个 Skill 与同类方案有什么区别?
技能将功能性库配方与性能配方作为两类明确替代方案:前者通过scripts/training/run_recipe.py用于训练,后者通过scripts/performance/run_script.py进行模拟数据吞吐量基准。