开发与工程 ✓ NVIDIA · 官方 taogpu-trainingjob-monitorings3-iokubernetesslurm

TAO 平台执行 SDK

在多种 GPU 平台上提交、监控并管理 NVIDIA TAO 训练任务。

FollowSkills 评估 · FSRS-2.0
不推荐
55/ 100 五分制 2.8 / 5
信任安全16 / 25 · 3.2/5

文档限制凭据读取为环境变量存在性检查,按平台筛选凭据,并说明 S3/HF/NGC 数据流、输出位置、取消和实例清理方式;但允许默认自动安装未锁定的 nvidia-tao-sdk[all],会产生网络与供应链外部影响,启动 GPU 作业前也缺少明确的最终执行确认,因此扣分。

可靠稳定8 / 20 · 2.0/5

核心 API、平台差异、轮询、错误模式和异常反馈说明较完整;但依赖版本未固定,关键 helper、skill_info.yaml、脚本和 SDK 实现不在选定技能证据中,且未提供覆盖关键路径的测试,因此按静态上限保守扣分。

适用触发11 / 15 · 3.7/5

目标用户、触发词、平台选择、监控偏好、非支持范围和本地 Docker 多节点限制较清楚;但没有中文使用指导,也未说明中国大陆网络、镜像仓库、PyPI、S3/HF/NGC 可达性,环境适配证据有限,因此扣分。

规范维护10 / 15 · 3.3/5

信息分层较好,具有前置检查、参考文档、错误模式、范围边界、示例、Apache-2.0 许可证、版本 0.1.0 和 NVIDIA 维护归属;但缺少推荐的 Instructions/Examples 章节,版本变更记录与明确更新流程不足,依赖安装假设也较隐蔽,因此扣分。

有效结果6 / 15 · 2.0/5

技能覆盖提交、监控、日志、S3 I/O、多节点和多平台作业,理论上能直接支持复杂 TAO 工作流;但静态材料没有验证真实作业输出,基准仅含一个计划说明任务,且自动安装和平台前置条件可能带来较高成本,因此不超过静态上限并扣分。

证据核验4 / 10 · 2.0/5

存在提交的 evals.json、BENCHMARK.md、错误映射和具体代码示例,提供一定审计线索;但只有一个评测任务、无负向任务或提交的关键路径测试,基准结果主要是报告性证据,无法独立复现完整结论,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应人工确认平台、镜像、凭据范围、数据 URI、输出持久化位置、GPU/云资源成本以及是否允许自动安装依赖。
  • 应锁定并审查 nvidia-tao-sdk[all] 及其平台依赖版本,并验证当前环境能访问所需包索引、容器注册表、S3、HF Hub 或 NGC。
  • 不要把本地路径直接用于 SLURM 或 Kubernetes;作业启动后应确认输出已持久化,而不是依赖容器临时目录。
  • 基准仅覆盖一个正向说明任务,不能证明真实 TAO 作业的正确性、可靠性或安全性。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能为 NVIDIA TAO Execution SDK 提供平台执行指导,适用于 Brev、SLURM、本地 Docker 和 Kubernetes。它帮助代理创建带有 Job 句柄的任务,轮询状态、读取日志、分析失败原因并获取结果目录。SDK 还可封装 S3 输入下载与输出上传,并支持多节点训练和平台特有功能。它适合需要持久化任务状态或长期监控的 TAO 用户,而不是只需直接使用 docker run 的简单场景。

检查并安装 Python 依赖 nvidia-tao-sdk[all];读取环境变量是否存在但不读取凭据值;根据选定平台获取所需凭据;使用 build_entrypoint 构造容器命令;调用 SDK 创建、查询、取消任务并读取日志、失败分析和结果目录;为声明的输入执行 S3、HF Hub 或 NGC 下载,并在运行结束后上传输出;支持 Brev 实例查询与删除,以及 S3、Lustre、PVC、bind 或 NFS 结果路径。

  1. 需要在 Brev GPU 实例上运行 TAO 训练并持续查看状态的用户。
  2. 需要通过 SLURM 和 Lustre 队列提交多节点分布式训练的团队。
  3. 需要让任务自动下载 S3 输入并上传训练结果的工程师。
  4. 需要在 Kubernetes Jobs 或本地 Docker 中调试 TAO 容器的开发者。
  5. 需要串联多个 TAO 任务并保存 job.id 和状态文件的用户。

这个 Skill 有哪些优点和局限?

优点
  • 统一覆盖 Brev、SLURM、本地 Docker 和 Kubernetes。
  • 提供任务句柄、状态轮询、日志读取、失败分析和取消操作。
  • 内置 S3 输入下载与输出上传流程。
  • 支持持久化 job.id 和状态文件,便于重新连接后台任务。
  • 明确区分平台凭据,并避免读取凭据实际值。
局限
  • 依赖 Python 3.10+、nvidia-tao-sdk[all] 和可用的 pip 配置。
  • 平台、S3 和容器环境可能需要额外环境变量或登录凭据。
  • 若没有持久化挂载或 S3,结果只能保存在容器临时目录中。
  • 监控需要保持聊天或运行时打开;无法长期保持时必须改为手动刷新。
  • 源码未提供该技能自身的测试套件或各平台的独立测试证据。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-run-platform --yes

技能将在代理下次加载技能并遇到相关任务时可用。运行技能前需安装依赖:

python -m pip install "nvidia-tao-sdk[all]"

README 未说明该技能单独发布包的费用。

如何使用这个 Skill?

向代理提出“use the TAO SDK”或“TAO platform run”,并说明要运行的 TAO 工作流。启动前选择 Brev、SLURM、本地 Docker 或 Kubernetes,确认是否持续监控以及状态更新间隔;默认监控开启、间隔为 5 分钟。随后确认默认容器镜像或提供 image=<override>,再按所选平台提供需要的环境变量。代理使用 SDK 创建任务并持续查询,直到任务完成、失败、取消,或用户要求停止监控。

这个 Skill 与同类方案有什么区别?

相较于直接使用 docker run,该技能适合需要 Job 句柄、长期监控、S3 I/O 封装、平台队列或多任务编排的场景;简单的 TAO 运行通常不需要 SDK。

常见问题

这个技能是否会自动读取我的云凭据?
不会。技能只检查环境变量是否存在,不读取凭据值;缺少必需变量时 SDK 会抛出 CredentialError。
支持哪些执行平台?
SKILL.md 明确支持 Brev、SLURM、本地 Docker 和 Kubernetes。
任务失败时能看到什么?
可以读取任务日志,并调用 get_failure_analysis() 获取错误类别、修复建议和节点事件。
是否能在任务排队很久时停止监控?
可以。默认会持续监控包括长时间 PENDING 在内的非终态任务,直到完成、失败、取消或用户要求停止。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

自动化与运维 ✓ NVIDIA · 官方

Megatron-LM 集群训练启动助手

帮助你在 SLURM GPU 集群上可靠启动、监控和排查多节点 Megatron-LM 训练任务。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

自动化与运维 ✓ NVIDIA · 官方

NeMo-RL Kubernetes 启动助手

在 Kubernetes 上启动、监控、迭代和排查 NeMo-RL 训练任务。

自动化与运维 ✓ NVIDIA · 官方

NeMo MBridge 多节点 Slurm 助手

将单节点 MBridge 脚本转换为多节点 Slurm 作业,并诊断启动、NCCL 与 MoE 显存问题。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

自动化与运维 ✓ NVIDIA · 官方

NeMo AutoModel 启动配置

为 NeMo AutoModel 配置交互式、多节点与云端任务启动。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 部署故障排查

按证据定位不健康的 Dynamo Kubernetes 部署。

开发与工程 ✓ NVIDIA · 官方

NeMo-RL 自动研究助手

将 NeMo-RL 研究目标转化为可复现的迭代实验。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 配方部署助手

在 Kubernetes 上选择、校验、修补并部署现有的 NVIDIA Dynamo 推理配方。

开发与工程 ✓ NVIDIA · 官方

I4H 机器人策略微调

在 LeRobot 数据集上微调 GR00T 或 openpi PI0 策略。

数据与分析 ✓ NVIDIA · 官方

PAIDF AnomalyGen 异常图像生成

微调模型并生成、评估和筛选合成异常图像。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

开发与工程 ✓ NVIDIA · 官方

NeMo MBridge 训练助手

帮助运行 Megatron-LM 与 Megatron Bridge 训练并核对损失曲线。

自动化与运维 ✓ NVIDIA · 官方

DOCA 管理服务运维技能

帮助运维团队部署、配置并排查 NVIDIA DMS 管理服务。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 路由启动器

快速配置 Dynamo 路由模式并验证前端端点可用性。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 互联就绪检查

在信任 Dynamo 分离式服务的性能数据前,验证 RDMA、NVLink 与 NIXL 传输链路是否就绪。

自动化与运维 ✓ NVIDIA · 官方

Physical AI 基础设施与弹性扩展

为合成数据生成工作流搭建、验证并恢复可扩展的 Physical AI 基础设施。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA RAG Blueprint 运维技能

帮助代理部署、配置、排障和管理 NVIDIA RAG Blueprint。

相关 Skills