自动化与运维 ✓ NVIDIA · 官方 nemo-automodelslurmskypilotdistributed-trainingtorchrunnsight-systems

NeMo AutoModel 启动配置

为 NeMo AutoModel 配置交互式、多节点与云端任务启动。

FollowSkills 评估 · FSRS-2.0
不推荐
54/ 100 五分制 2.7 / 5
信任安全16 / 25 · 3.2/5

技能仅提供配置建议和命令示例,没有明显恶意、凭据窃取或破坏性默认行为;使用 HF_TOKEN、WANDB_API_KEY、云端提交、容器挂载和环境变量,且提醒 spot 抢占与 profiling 开销。扣分在于未要求执行前确认、未充分说明凭据处理、权限范围、外部副作用或回滚方案。

可靠稳定8 / 20 · 2.0/5

说明覆盖 interactive、Slurm、SkyPilot、profiling 的主要路径,字段和常见故障点较连贯。扣分在于未记录前置依赖、版本兼容性、失败诊断和故障恢复;SkyPilot 多节点环境变量说明与其示例缺少 ntasks_per_node,可能造成适用性歧义。静态评估不超过10分。

适用触发11 / 15 · 3.7/5

名称、触发条件、三种启动方式和明确的 Routing Boundary 较清晰,能区分 launcher 配置与模型 onboarding。扣分在于未充分定义非适用场景、输入校验和环境要求;中文支持未说明,Slurm/云服务在中国大陆网络中的可达性也未验证,但交互式和本地 Slurm 并非完全依赖海外服务。

规范维护9 / 15 · 3.0/5

SKILL.md 结构清晰,包含元数据、模板、字段说明、示例、陷阱和代码锚点;skill-card 补充 Apache 2.0、负责人、版本和参考资料。扣分在于缺少 Purpose、正式 Examples、前置要求、限制、troubleshooting、变更日志和明确维护更新路径;BENCHMARK.md 也记录了这些静态检查缺陷。

有效结果6 / 15 · 2.0/5

内容直接产出可复制的 YAML、bash 和运行行为说明,三项评测任务的 ground truth 与技能内容基本对应,且 benchmark 报告称正确性和有效性较高。扣分在于评测仅覆盖3个正向场景、没有负向触发测试,报告无法在本次静态审查中独立复现;真实环境中的配置正确性和直接可运行性仍需人工核验。静态评估不超过7分。

证据核验4 / 10 · 2.0/5

存在固定修订版本、评测任务、ground truth、结果摘要、代码锚点和外部参考名称,提供了一定可审计线索。扣分在于没有原始执行日志、CI 测试或覆盖该技能关键路径的提交测试,benchmark 结果主要是声明性摘要,无法独立复现。静态评估不超过5分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应人工确认 Slurm、容器、挂载、云资源和环境变量权限,并避免将真实凭据写入配置或日志。
  • 应补充 NeMo AutoModel、torchrun、Slurm、SkyPilot、Nsight Systems 的版本与前置依赖,以及失败诊断、恢复和回滚说明。
  • SkyPilot 云区域、镜像仓库和 Hugging Face 等依赖的中国大陆网络可达性未验证;spot 抢占和 checkpoint 恢复仍可能造成任务中断或数据损失。
  • benchmark 只有3个正向任务且未提供原始执行证据,不能替代目标环境中的验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导 NeMo AutoModel 在当前节点、Slurm HPC 集群或 SkyPilot 云环境中启动任务。它覆盖 torchrun、多节点 rendezvous、容器、挂载、环境变量和 Nsight Systems profiling。Slurm 与 SkyPilot 启动器会自动配置多节点通信环境。它适合需要编写或排查任务启动 YAML 的用户,不负责模型架构接入或 state-dict 适配。

根据用户的启动场景生成或调整 YAML 配置;说明交互式模式下的 automodel 或 torchrun 命令;配置 Slurm 的作业名、节点数、每节点任务数、时间、账户、分区、容器镜像、挂载、缓存路径、环境变量和 master_port;配置 SkyPilot 的云厂商、GPU、节点数、抢占式实例、磁盘、区域和 setup 命令;解释 WORLD_SIZE、MASTER_ADDR、MASTER_PORT 与 NCCL 环境变量;为 Slurm 启用 nsys profile 并说明 .nsys-rep 报告位置;提供抢占后 checkpoint 恢复建议。

  1. NeMo AutoModel 用户需要在单节点上用全部 GPU 进行开发或调试时,使用交互式 torchrun 启动。
  2. HPC 用户需要提交多节点 Slurm 训练作业时,使用 Slurm YAML 配置资源、容器和分布式通信。
  3. 云端训练用户需要在 AWS、GCP、Azure、Lambda 或 Kubernetes 上提交 SkyPilot 作业时,使用 SkyPilot 配置。
  4. 使用 SkyPilot spot 实例的用户需要降低抢占造成的损失时,配置短 checkpoint 间隔和 restore_from。
  5. Slurm 用户需要诊断性能问题时,启用 Nsight Systems 生成 .nsys-rep 报告。
  6. 任务提交失败的用户需要排查端口冲突、缺失挂载路径、环境变量展开或时间限制问题时,参考故障提示。

这个 Skill 有哪些优点和局限?

优点
  • 同时覆盖交互式、Slurm 和 SkyPilot 三种启动方式。
  • 明确列出多节点通信、容器挂载和环境变量的关键字段。
  • 包含端口冲突、spot 抢占、异步 checkpoint 和 profiling 开销等实际故障提示。
  • 技能元数据显示作者为 NVIDIA,技能许可证为 Apache-2.0。
局限
  • 只覆盖启动机制,不负责模型架构实现、Hugging Face state-dict 适配或模型文件。
  • Slurm 和 SkyPilot 的实际可用性取决于用户已有的集群、云账户和运行环境。
  • 提供的材料没有给出独立测试结果、支持平台矩阵或具体版本兼容性。
  • Nsight profiling 会增加开销并产生较大的报告文件,不适合常规生产训练。

如何安装这个 Skill?

使用仓库 README 中的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill nemo-automodel-launcher-config --yes

也可以指定 Codex:

npx skills add nvidia/skills --skill nemo-automodel-launcher-config --agent codex --yes

来源未说明该技能的独立安装包、版本要求或手动复制后的具体目录。

如何使用这个 Skill?

安装后,在相关任务中直接提出启动配置请求,例如:“为 NeMo AutoModel 生成一个 2 节点、每节点 8 个任务的 Slurm 配置”或“配置 SkyPilot spot 训练并支持 checkpoint 恢复”。交互式模式无需额外 YAML 段;没有 slurm: 或 skypilot: 时,CLI 自动路由到 torchrun。Slurm、SkyPilot 和 profiling 请求应提供相应配置字段。

这个 Skill 与同类方案有什么区别?

交互式启动适合当前节点上的开发和调试;Slurm 适合 HPC 批处理和多节点资源调度;SkyPilot 适合云端、跨云和 spot 实例任务。三者是该技能明确支持的互斥启动路径。

常见问题

这个技能本身是否运行训练任务?
材料显示它提供启动配置和回答模式;实际训练仍由 automodel、torchrun、Slurm 或 SkyPilot 环境执行。
使用 Slurm 必须提供哪些资源字段?
核心字段包括 job_name、nodes、ntasks_per_node、time、account 或 partition,以及通常的 container_image、hf_home、环境变量和 master_port。
SkyPilot spot 被抢占后如何减少损失?
将 use_spot 设为 true,使用较短的 step_scheduler.checkpoint_interval,并通过 restore_from.path 恢复最近的 checkpoint。
为什么任务提交会失败?
常见原因包括 master_port 冲突、extra_mounts 的 source 在所有节点不存在、环境变量未使用 ${VAR} 语法,以及 Slurm 时间限制不足以完成异步 checkpoint。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 分布式训练配置

为 NeMo AutoModel 选择并配置多 GPU 与多节点训练策略。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 配方开发

帮助构建、修改和验证 NeMo AutoModel 训练与评估配方。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

自动化与运维 ✓ NVIDIA · 官方

NeMo MBridge 多节点 Slurm 助手

将单节点 MBridge 脚本转换为多节点 Slurm 作业,并诊断启动、NCCL 与 MoE 显存问题。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge GPU 内存调优

诊断 Megatron Bridge 训练中的 GPU OOM,并降低碎片、激活和 PEFT 内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

开发与工程 ✓ NVIDIA · 官方

Megatron Bridge 激活重计算

在 Megatron Bridge 中用额外计算换取更低的 GPU 激活内存占用。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 并行策略指南

为 Megatron Bridge 训练选择、组合并核验并行策略。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 专家并行重叠

为 Megatron-Bridge 配置、验证并排查 MoE 专家并行通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练韧性

为 Megatron Bridge 分布式训练启用故障恢复与挂起检测。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CPU Offload

为 Megatron Bridge 配置、验证并排查 CPU 卸载,以缓解 GPU 显存压力。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge CUDA 图优化

在 Megatron Bridge 训练中配置、验证并评估 CUDA Graph,以降低主机驱动开销。

开发与工程 ✓ NVIDIA · 官方

TAO 平台执行 SDK

在多种 GPU 平台上提交、监控并管理 NVIDIA TAO 训练任务。

开发与工程 ✓ NVIDIA · 官方

Megatron FSDP 配置与性能指南

帮助在 Megatron-Bridge 中启用、排查并验证 Megatron FSDP。

开发与工程 ✓ NVIDIA · 官方

Megatron-Bridge 通信重叠调优指南

帮助分布式训练用户配置并验证 TP、DP 与 PP 通信重叠。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge MoE 性能优化工作流

系统化定位并优化 Megatron Bridge 中 MoE 训练吞吐瓶颈。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 配方推荐器

根据模型、GPU规模和训练目标推荐可调整的Megatron Bridge配方。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 分层上下文并行

帮助在 Megatron-Bridge 中启用、排查并验证分层上下文并行。

开发与工程 ✓ NVIDIA · 官方

DeepStream 性能剖析器

用实测数据调优 DeepStream 管线并定位性能瓶颈。

相关 Skills