NeMo AutoModel 启动配置
为 NeMo AutoModel 配置交互式、多节点与云端任务启动。
技能仅提供配置建议和命令示例,没有明显恶意、凭据窃取或破坏性默认行为;使用 HF_TOKEN、WANDB_API_KEY、云端提交、容器挂载和环境变量,且提醒 spot 抢占与 profiling 开销。扣分在于未要求执行前确认、未充分说明凭据处理、权限范围、外部副作用或回滚方案。
说明覆盖 interactive、Slurm、SkyPilot、profiling 的主要路径,字段和常见故障点较连贯。扣分在于未记录前置依赖、版本兼容性、失败诊断和故障恢复;SkyPilot 多节点环境变量说明与其示例缺少 ntasks_per_node,可能造成适用性歧义。静态评估不超过10分。
名称、触发条件、三种启动方式和明确的 Routing Boundary 较清晰,能区分 launcher 配置与模型 onboarding。扣分在于未充分定义非适用场景、输入校验和环境要求;中文支持未说明,Slurm/云服务在中国大陆网络中的可达性也未验证,但交互式和本地 Slurm 并非完全依赖海外服务。
SKILL.md 结构清晰,包含元数据、模板、字段说明、示例、陷阱和代码锚点;skill-card 补充 Apache 2.0、负责人、版本和参考资料。扣分在于缺少 Purpose、正式 Examples、前置要求、限制、troubleshooting、变更日志和明确维护更新路径;BENCHMARK.md 也记录了这些静态检查缺陷。
内容直接产出可复制的 YAML、bash 和运行行为说明,三项评测任务的 ground truth 与技能内容基本对应,且 benchmark 报告称正确性和有效性较高。扣分在于评测仅覆盖3个正向场景、没有负向触发测试,报告无法在本次静态审查中独立复现;真实环境中的配置正确性和直接可运行性仍需人工核验。静态评估不超过7分。
存在固定修订版本、评测任务、ground truth、结果摘要、代码锚点和外部参考名称,提供了一定可审计线索。扣分在于没有原始执行日志、CI 测试或覆盖该技能关键路径的提交测试,benchmark 结果主要是声明性摘要,无法独立复现。静态评估不超过5分。
- 执行前应人工确认 Slurm、容器、挂载、云资源和环境变量权限,并避免将真实凭据写入配置或日志。
- 应补充 NeMo AutoModel、torchrun、Slurm、SkyPilot、Nsight Systems 的版本与前置依赖,以及失败诊断、恢复和回滚说明。
- SkyPilot 云区域、镜像仓库和 Hugging Face 等依赖的中国大陆网络可达性未验证;spot 抢占和 checkpoint 恢复仍可能造成任务中断或数据损失。
- benchmark 只有3个正向任务且未提供原始执行证据,不能替代目标环境中的验证。
这个 Skill 能做什么,适合哪些场景?
该技能指导 NeMo AutoModel 在当前节点、Slurm HPC 集群或 SkyPilot 云环境中启动任务。它覆盖 torchrun、多节点 rendezvous、容器、挂载、环境变量和 Nsight Systems profiling。Slurm 与 SkyPilot 启动器会自动配置多节点通信环境。它适合需要编写或排查任务启动 YAML 的用户,不负责模型架构接入或 state-dict 适配。
根据用户的启动场景生成或调整 YAML 配置;说明交互式模式下的 automodel 或 torchrun 命令;配置 Slurm 的作业名、节点数、每节点任务数、时间、账户、分区、容器镜像、挂载、缓存路径、环境变量和 master_port;配置 SkyPilot 的云厂商、GPU、节点数、抢占式实例、磁盘、区域和 setup 命令;解释 WORLD_SIZE、MASTER_ADDR、MASTER_PORT 与 NCCL 环境变量;为 Slurm 启用 nsys profile 并说明 .nsys-rep 报告位置;提供抢占后 checkpoint 恢复建议。
- NeMo AutoModel 用户需要在单节点上用全部 GPU 进行开发或调试时,使用交互式 torchrun 启动。
- HPC 用户需要提交多节点 Slurm 训练作业时,使用 Slurm YAML 配置资源、容器和分布式通信。
- 云端训练用户需要在 AWS、GCP、Azure、Lambda 或 Kubernetes 上提交 SkyPilot 作业时,使用 SkyPilot 配置。
- 使用 SkyPilot spot 实例的用户需要降低抢占造成的损失时,配置短 checkpoint 间隔和 restore_from。
- Slurm 用户需要诊断性能问题时,启用 Nsight Systems 生成 .nsys-rep 报告。
- 任务提交失败的用户需要排查端口冲突、缺失挂载路径、环境变量展开或时间限制问题时,参考故障提示。
这个 Skill 有哪些优点和局限?
- 同时覆盖交互式、Slurm 和 SkyPilot 三种启动方式。
- 明确列出多节点通信、容器挂载和环境变量的关键字段。
- 包含端口冲突、spot 抢占、异步 checkpoint 和 profiling 开销等实际故障提示。
- 技能元数据显示作者为 NVIDIA,技能许可证为 Apache-2.0。
- 只覆盖启动机制,不负责模型架构实现、Hugging Face state-dict 适配或模型文件。
- Slurm 和 SkyPilot 的实际可用性取决于用户已有的集群、云账户和运行环境。
- 提供的材料没有给出独立测试结果、支持平台矩阵或具体版本兼容性。
- Nsight profiling 会增加开销并产生较大的报告文件,不适合常规生产训练。
如何安装这个 Skill?
使用仓库 README 中的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill nemo-automodel-launcher-config --yes
也可以指定 Codex:
npx skills add nvidia/skills --skill nemo-automodel-launcher-config --agent codex --yes
来源未说明该技能的独立安装包、版本要求或手动复制后的具体目录。
如何使用这个 Skill?
安装后,在相关任务中直接提出启动配置请求,例如:“为 NeMo AutoModel 生成一个 2 节点、每节点 8 个任务的 Slurm 配置”或“配置 SkyPilot spot 训练并支持 checkpoint 恢复”。交互式模式无需额外 YAML 段;没有 slurm: 或 skypilot: 时,CLI 自动路由到 torchrun。Slurm、SkyPilot 和 profiling 请求应提供相应配置字段。
这个 Skill 与同类方案有什么区别?
交互式启动适合当前节点上的开发和调试;Slurm 适合 HPC 批处理和多节点资源调度;SkyPilot 适合云端、跨云和 spot 实例任务。三者是该技能明确支持的互斥启动路径。