开发与工程 ✓ NVIDIA · 官方 nemo-automodelrecipe-developmentyaml-configurationdistributed-trainingcheckpointingpytorch

NeMo AutoModel 配方开发

帮助构建、修改和验证 NeMo AutoModel 训练与评估配方。

FollowSkills 评估 · FSRS-2.0
不推荐
55/ 100 五分制 2.8 / 5
信任安全17 / 25 · 3.4/5

该技能主要提供配置和开发建议,不要求凭据、网络访问或高权限操作,并明确提示不要在提示、日志或输出中泄露秘密,因此未见红线风险。扣分原因是未明确用户确认、变更回滚、数据流、依赖安全或执行副作用控制;来源归属虽可由 NVIDIA 元数据和仓库治理材料支持,但许可证元数据显示为 NOASSERTION。

可靠稳定8 / 20 · 2.0/5

说明包含较清晰的路由边界、执行流程、配置示例和常见陷阱;BENCHMARK.md 报告了三项任务的准确性结果。扣分原因是本次仅静态阅读,未复现关键路径,未见该技能专属测试套件或明确的异常输入、版本兼容和失败反馈机制;按静态校准不超过 10 分。

适用触发11 / 15 · 3.7/5

目标受众、适用场景、触发条件和不适用范围均有明确描述,覆盖训练、SFT、评估、YAML、builder 和 CLI 路由。扣分原因是没有系统定义输入输出边界、负向触发案例或环境前置条件,也未提供中文支持说明;核心功能不依赖特定海外在线服务,因此未因中国大陆可达性额外扣分。

规范维护9 / 15 · 3.0/5

文档有 front matter、分层章节、示例、路由边界、依赖提示、已知陷阱以及 benchmark 和 skill card;技能声明 Apache-2.0,仓库也提供许可证文本。扣分原因是版本、变更记录、维护责任和更新路径不完整,BENCHMARK 的静态校验发现 author 格式问题,且仓库许可证元数据为 NOASSERTION。

有效结果6 / 15 · 2.0/5

技能直接给出新 recipe、_target_、验证与 checkpoint 场景的操作路径、配置片段和命令,BENCHMARK.md 报告三项正向任务的 Codex 正确性 95% 和有效性 93%。扣分原因是只有三项正向任务、没有负向任务,且没有可独立核验的代表性最终产物或实际项目结果;静态校准最高不超过 7 分。

证据核验4 / 10 · 2.0/5

存在修订固定的源文件、评测任务、预期行为和 benchmark 报告,具备一定审计线索。扣分原因是评测覆盖很窄,未提供可独立重跑的测试代码或多来源交叉证据,报告结果本身无法在本次静态审查中验证;按静态校准最高不超过 5 分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 使用前应核对 NeMo AutoModel 当前版本、真实模块路径和 CLI 行为;文档中的示例可能随上游变更而失效。
  • 不要将技能建议视为已验证的训练配置;执行前应由用户确认数据、模型、checkpoint 路径、资源消耗和潜在覆盖风险。
  • 建议补充负向触发评测、技能专属可重跑测试、版本兼容矩阵、维护负责人和变更记录。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NeMo AutoModel 的训练、微调和评估配方开发。它解释 YAML 配置结构、`_target_` 可调用对象、组件构建器、CLI 路由和训练执行流程。内容覆盖 LLM、VLM、扩散模型和检索配方的具体文件与配置。它还规定验证、检查点、恢复训练及本地测试的关键配置和命令。

指导代理定位 nemo_automodel/recipes/ 下的配方文件和 YAML 区段,列出模型、优化器、数据加载器、损失、学习率调度器、步进调度器及检查点构建器;解释 _target_ 如何调用 Python 可调用对象并传递关键字参数;生成或说明最小 YAML、CLI 覆盖示例和 automodel finetune llm -c <config.yaml> 验证命令;检查验证频率、检查点频率、恢复路径、批大小计算、CLI 路由和数据整理器匹配问题。

  1. NeMo AutoModel 开发者新增一个 LLM 微调或预训练配方变体,需要选择基础文件、更新构建器并注册 CLI 路由。
  2. 训练工程师需要为优化器、数据集或调度器增加 YAML 字段,并确认 `_target_` 与嵌套 CLI 覆盖方式。
  3. 模型工程师需要配置验证数据集、验证间隔、检查点保存间隔或从检查点恢复训练。
  4. 排障人员遇到首步崩溃、前向形状不匹配、验证 OOM 或检查点恢复失败,需要按配方执行流定位问题。
  5. 测试人员需要为新配方添加小型 CPU 兼容单元测试并执行本地验证。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖配方 YAML、构建器、CLI 路由、训练循环、验证和检查点配置。
  • 提供明确的执行流、基础配置结构、常见陷阱和可复制的命令示例。
  • 明确限定范围,避免将独立分布式策略、集群启动器或模型架构入门问题混入配方指导。
局限
  • 专注于 NeMo AutoModel 配方开发,不适合独立的集群启动器或分布式策略选型。
  • 提供的材料未列出该技能自身的测试文件、支持平台矩阵或版本兼容范围。
  • 部分示例引用具体仓库路径和 CLI,实际可用性仍取决于对应 NeMo AutoModel 环境。

如何安装这个 Skill?

使用仓库 README 提供的 Skills CLI 安装指定技能:npx skills add nvidia/skills --skill nemo-automodel-recipe-development --yes。也可追加 --agent codex 安装到 Codex。源材料未说明其他安装方式或版本要求。

如何使用这个 Skill?

安装后,在相关任务中请求代理创建或修改 NeMo AutoModel 配方,例如:请为 NeMo AutoModel 新增一个 LLM 微调配方变体,并说明需要修改的 YAML、builder 函数、CLI 路由和 CPU 验证命令。 配方运行示例为 automodel finetune llm -c config.yaml,并可使用 --optimizer.lr--step_scheduler.max_steps 等嵌套覆盖。

常见问题

这个技能是否会直接修改我的仓库文件?
源材料将其定义为配方开发指导,并未说明会自动修改文件;是否执行编辑取决于宿主代理和用户请求。
是否需要 GPU 或集群才能使用?
技能内容包含分布式训练配置,但也要求添加并运行 CPU 兼容的小型测试;源材料没有声明完整配方可在 CPU 上训练。
检查点恢复应配置什么?
使用 `restore_from.path` 指向检查点目录,并保持模型架构配置与检查点一致;技能推荐使用 consolidated safetensors 格式。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

自动化与运维 ✓ NVIDIA · 官方

NeMo AutoModel 启动配置

为 NeMo AutoModel 配置交互式、多节点与云端任务启动。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

DALI 动态模式开发助手

帮助 AI 代理编写、审查和迁移 NVIDIA DALI 命令式动态模式代码。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

开发与工程 ✓ NVIDIA · 官方

Jetson 目标平台切换器

在已有 Jetson 平台配置之间切换当前活动目标。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

Jetson 目标平台初始化

为 Jetson 开发套件或定制载板创建目标平台配置并更新活动指针。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

相关 Skills