自动化与运维 ✓ NVIDIA · 官方 slurmsshgpu-clusterpyxis-enrootlustre-storagetao-toolkit

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

FollowSkills 评估 · FSRS-2.0
不推荐
55/ 100 五分制 2.8 / 5
信任安全18 / 25 · 3.6/5

文档要求批量 SSH、共享存储、容器执行和 sbatch/scancel 等高影响外部操作,并允许 Bash;对 NGC_KEY 提供不回显、权限收紧的传输方式,也记录了数据路径约束、取消和失败重试。但提交任务、安装依赖、修改远程凭据和自动重试缺少一致的逐项用户确认、最小权限说明及完整回滚方案,因此扣7分。

可靠稳定8 / 20 · 2.0/5

主流程、资源默认值、状态映射、日志位置和部分失败模式有明确说明;但文档对 TAO SDK 是否可从公共 PyPI 安装存在直接矛盾,引用的 tao-skill-bank 依赖未在本路径提供,且没有可执行的提交/监控测试套件,因此按静态上限给8分,扣除环境可复现性、依赖一致性和边界错误处理不足。

适用触发10 / 15 · 3.3/5

目标用户、SLURM/DGX/Pyxis/Enroot/Lustre 场景、必需凭据和本地数据不适用边界较清楚,并列出触发短语;但没有中文使用说明或语义排除示例,也未讨论中国大陆网络访问公共 PyPI、GitLab、nvcr.io、HF/NGC 等依赖的可达性,因此扣5分。

规范维护9 / 15 · 3.0/5

SKILL.md 有 front matter、版本、许可证、标签、分层参考文件和维护导航,且给出资源默认值、限制和故障提示;但缺少 Instructions/Examples 推荐章节,版本与变更记录不完整,作者格式被基准指出不符合规范,引用内容重复且 SDK 安装说明不一致,因此扣6分。

有效结果6 / 15 · 2.0/5

技能覆盖从 SSH 预检、数据验证、容器化 sbatch、分布式运行到监控、取消和重试的核心流程,示例输出可作为实施参考;但只提供一个不执行命令的正向评测任务,没有真实运行结果或关键路径验证,且用户仍需准备集群、凭据、数据和环境,静态证据不足以证明端到端结果,因此按静态上限给6分并扣1分。

证据核验4 / 10 · 2.0/5

提供了提交脚本示例、状态映射、失败模式、评测文件和一份基准报告;但评测仅1个任务、无负向任务,报告未提供可复核的执行产物,且关键实现位于本路径之外,无法独立重现,因此给4分并扣除覆盖面和独立复核证据。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 该技能会通过 SSH 远程执行 sbatch、srun、scancel,并可能写入远程 Enroot 凭据;正式使用前应对提交、凭据安装、自动重试和取消设置明确的用户确认与审计边界。
  • SKILL.md 与参考文件对 nvidia-tao-sdk 的安装来源相互矛盾,应先统一并固定版本;还应验证 PyPI、GitLab、nvcr.io、HF/NGC 在目标网络中的可达性。
  • 评测只有一个不执行命令的正向任务,不能证明真实集群上的训练、监控、重试或取消流程。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导 AI 代理在由 SLURM 管理的远程 GPU 集群上提交、执行、监控和取消 TAO 训练、评估与推理作业。它通过 SSH 连接登录节点,使用 Lustre 共享存储准备数据和结果,并通过 Pyxis/Enroot 运行 TAO 容器。技能涵盖单节点和多节点资源配置、状态映射、日志读取及基础设施故障自动重试。它适合已有集群、调度器 GPU 分配和共享 Lustre 存储的团队,不适用于仅存在于代理本机的文件。

检查 SLURM_USER、SLURM_HOSTNAME 和无密码 SSH;验证集群上的数据路径;准备规格、环境和云元数据文件;可选地将 Docker 镜像转换为 SQSH 缓存;生成 sbatch 脚本并提交作业;使用 srun 和 Pyxis/Enroot 启动 TAO 容器;通过 squeue、sacct、status.json 和 SSH 日志监控状态;根据 SLURM 状态映射终态;通过 scancel 取消作业;为多节点任务配置分布式环境变量,并支持 SDK 场景下的基础设施故障重试。

  1. TAO 用户需要把训练作业提交到已有的 DGX SLURM 集群,并将数据放在 Lustre 上。
  2. 平台工程师需要通过 SSH、sbatch 和 srun 运行带 Pyxis/Enroot 容器的 GPU 作业。
  3. 团队需要监控排队时间较长的 SLURM 作业、读取远程日志并在必要时取消任务。
  4. 分布式训练用户需要在多个节点间自动设置 WORLD_SIZE、NODE_RANK、MASTER_ADDR 和 MASTER_PORT。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从 SSH 预检到提交、监控、日志、取消和终态处理的完整 SLURM 流程。
  • 明确要求使用 Lustre 作为远程作业输入,并包含数据路径预验证。
  • 支持 Pyxis/Enroot、SQSH 缓存、多节点环境变量和 SDK 基础设施故障重试。
局限
  • 必须已有 SLURM GPU 集群、登录节点 SSH 权限和共享 Lustre 存储。
  • 技能正文依赖多个未随提示提供的 references 文件,完整细节不能仅从 SKILL.md 获得。
  • 没有提供具体集群的分区、账号策略或经过验证的平台兼容性清单。
  • TAO SDK 仅在需要 Job handles、S3 包装或 ActionWorkflow 持久化时才需要,但相关使用路径较复杂。

如何安装这个 Skill?

使用 NVIDIA 技能集合的 CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-run-on-slurm --yes

README 说明无需克隆仓库或手动复制技能目录;技能将在代理下次加载相关技能时可用。

如何使用这个 Skill?

先确保代理可访问 SLURM 登录节点,并导出 SLURM_USER 与 SLURM_HOSTNAME;还需要可用的 SSH 密钥认证、SLURM_PARTITION,以及集群上的共享 Lustre 数据路径。然后向代理输入例如“run on SLURM”或“submit sbatch”,并提供所需的作业、资源、镜像和数据参数。若使用私有 nvcr.io 镜像,还需按技能说明在集群上配置 Enroot 凭据。

常见问题

这个技能适合本地运行吗?
不适合。它面向远程 SLURM GPU 集群;本地文件必须先放到集群可访问的共享文件系统上。
必须安装 TAO SDK 吗?
不是。只有需要 Job handles、S3 I/O 包装或通过 ActionWorkflow 实现运行目录持久化时,才需要安装 nvidia-tao-sdk[slurm]。
需要哪些权限和凭据?
需要登录节点 SSH 权限,推荐使用私钥进行无密码认证;私有 nvcr.io 镜像还需要在集群上持久配置 Enroot 凭据。
作业失败会自动重试吗?
SDK 可自动重试特定基础设施故障,例如 NODE_FAIL、BOOT_FAIL、NCCL 传输超时和部分 GPU 或驱动故障;普通训练失败会直接暴露。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

开发与工程 ✓ NVIDIA · 官方

TAO 平台执行 SDK

在多种 GPU 平台上提交、监控并管理 NVIDIA TAO 训练任务。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

自动化与运维 ✓ NVIDIA · 官方

NeMo MBridge 多节点 Slurm 助手

将单节点 MBridge 脚本转换为多节点 Slurm 作业,并诊断启动、NCCL 与 MoE 显存问题。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 图像指代表达定位

将图像和文字描述转换为带像素级边界框的短语定位标注。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO VLM 二分类差距分析

从 VLM 是非预测中提取误报和漏报样本,支持后续根因分析。

数据与分析 ✓ NVIDIA · 官方

TAO 姿态分类

用 ST-GCN 将姿态关键点序列分类为动作类别。

相关 Skills