TAO SLURM 集群运行
通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。
文档要求批量 SSH、共享存储、容器执行和 sbatch/scancel 等高影响外部操作,并允许 Bash;对 NGC_KEY 提供不回显、权限收紧的传输方式,也记录了数据路径约束、取消和失败重试。但提交任务、安装依赖、修改远程凭据和自动重试缺少一致的逐项用户确认、最小权限说明及完整回滚方案,因此扣7分。
主流程、资源默认值、状态映射、日志位置和部分失败模式有明确说明;但文档对 TAO SDK 是否可从公共 PyPI 安装存在直接矛盾,引用的 tao-skill-bank 依赖未在本路径提供,且没有可执行的提交/监控测试套件,因此按静态上限给8分,扣除环境可复现性、依赖一致性和边界错误处理不足。
目标用户、SLURM/DGX/Pyxis/Enroot/Lustre 场景、必需凭据和本地数据不适用边界较清楚,并列出触发短语;但没有中文使用说明或语义排除示例,也未讨论中国大陆网络访问公共 PyPI、GitLab、nvcr.io、HF/NGC 等依赖的可达性,因此扣5分。
SKILL.md 有 front matter、版本、许可证、标签、分层参考文件和维护导航,且给出资源默认值、限制和故障提示;但缺少 Instructions/Examples 推荐章节,版本与变更记录不完整,作者格式被基准指出不符合规范,引用内容重复且 SDK 安装说明不一致,因此扣6分。
技能覆盖从 SSH 预检、数据验证、容器化 sbatch、分布式运行到监控、取消和重试的核心流程,示例输出可作为实施参考;但只提供一个不执行命令的正向评测任务,没有真实运行结果或关键路径验证,且用户仍需准备集群、凭据、数据和环境,静态证据不足以证明端到端结果,因此按静态上限给6分并扣1分。
提供了提交脚本示例、状态映射、失败模式、评测文件和一份基准报告;但评测仅1个任务、无负向任务,报告未提供可复核的执行产物,且关键实现位于本路径之外,无法独立重现,因此给4分并扣除覆盖面和独立复核证据。
- 该技能会通过 SSH 远程执行 sbatch、srun、scancel,并可能写入远程 Enroot 凭据;正式使用前应对提交、凭据安装、自动重试和取消设置明确的用户确认与审计边界。
- SKILL.md 与参考文件对 nvidia-tao-sdk 的安装来源相互矛盾,应先统一并固定版本;还应验证 PyPI、GitLab、nvcr.io、HF/NGC 在目标网络中的可达性。
- 评测只有一个不执行命令的正向任务,不能证明真实集群上的训练、监控、重试或取消流程。
这个 Skill 能做什么,适合哪些场景?
该技能指导 AI 代理在由 SLURM 管理的远程 GPU 集群上提交、执行、监控和取消 TAO 训练、评估与推理作业。它通过 SSH 连接登录节点,使用 Lustre 共享存储准备数据和结果,并通过 Pyxis/Enroot 运行 TAO 容器。技能涵盖单节点和多节点资源配置、状态映射、日志读取及基础设施故障自动重试。它适合已有集群、调度器 GPU 分配和共享 Lustre 存储的团队,不适用于仅存在于代理本机的文件。
检查 SLURM_USER、SLURM_HOSTNAME 和无密码 SSH;验证集群上的数据路径;准备规格、环境和云元数据文件;可选地将 Docker 镜像转换为 SQSH 缓存;生成 sbatch 脚本并提交作业;使用 srun 和 Pyxis/Enroot 启动 TAO 容器;通过 squeue、sacct、status.json 和 SSH 日志监控状态;根据 SLURM 状态映射终态;通过 scancel 取消作业;为多节点任务配置分布式环境变量,并支持 SDK 场景下的基础设施故障重试。
- TAO 用户需要把训练作业提交到已有的 DGX SLURM 集群,并将数据放在 Lustre 上。
- 平台工程师需要通过 SSH、sbatch 和 srun 运行带 Pyxis/Enroot 容器的 GPU 作业。
- 团队需要监控排队时间较长的 SLURM 作业、读取远程日志并在必要时取消任务。
- 分布式训练用户需要在多个节点间自动设置 WORLD_SIZE、NODE_RANK、MASTER_ADDR 和 MASTER_PORT。
这个 Skill 有哪些优点和局限?
- 覆盖从 SSH 预检到提交、监控、日志、取消和终态处理的完整 SLURM 流程。
- 明确要求使用 Lustre 作为远程作业输入,并包含数据路径预验证。
- 支持 Pyxis/Enroot、SQSH 缓存、多节点环境变量和 SDK 基础设施故障重试。
- 必须已有 SLURM GPU 集群、登录节点 SSH 权限和共享 Lustre 存储。
- 技能正文依赖多个未随提示提供的 references 文件,完整细节不能仅从 SKILL.md 获得。
- 没有提供具体集群的分区、账号策略或经过验证的平台兼容性清单。
- TAO SDK 仅在需要 Job handles、S3 包装或 ActionWorkflow 持久化时才需要,但相关使用路径较复杂。
如何安装这个 Skill?
使用 NVIDIA 技能集合的 CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-run-on-slurm --yes
README 说明无需克隆仓库或手动复制技能目录;技能将在代理下次加载相关技能时可用。
如何使用这个 Skill?
先确保代理可访问 SLURM 登录节点,并导出 SLURM_USER 与 SLURM_HOSTNAME;还需要可用的 SSH 密钥认证、SLURM_PARTITION,以及集群上的共享 Lustre 数据路径。然后向代理输入例如“run on SLURM”或“submit sbatch”,并提供所需的作业、资源、镜像和数据参数。若使用私有 nvcr.io 镜像,还需按技能说明在集群上配置 Enroot 凭据。