自动化与运维 ✓ NVIDIA · 官方 dockernvidia-gputao-toolkitremote-dockergpu-jobslocal-execution

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全12 / 25 · 2.4/5

文档披露了 Docker、远程 DOCKER_HOST、GPU、S3、NGC_KEY、HF_TOKEN 和 SSH 密钥等数据流,并要求部分安装先获用户批准;但 allowed-tools 包含宽泛 Bash,Docker 守护进程具有高权限,容器同名替换会停止并删除旧容器,且缺少启动前逐项确认、最小挂载、密钥防泄漏和回滚说明,因此扣分。未见恶意软件、凭据窃取或隐蔽外传等红线。

可靠稳定8 / 20 · 2.0/5

主流程、预检、GPU 分配、状态映射、日志和失败模式均有说明,且存在一份单任务外部评估报告;但静态材料未证明关键路径可复现,路径变量 TAO_SKILL_BANK_ROOT、TAO_SKILL_BANK_PATH 和默认 helper 路径不完全一致,安装依赖、远程路径和镜像兼容性仍有未覆盖边界,因此受静态上限限制并扣分。

适用触发9 / 15 · 3.0/5

目标用户、local/remote Docker 场景以及不适用的多节点和 SLURM 场景定义清楚,触发短语也较具体;但输入/输出契约、非适用边界和 Docker 挂载约定仍不完整,文档仅英文,且 NGC、PyPI、SSH 及云存储可达性对中国大陆环境未说明,因此扣分。

规范维护9 / 15 · 3.0/5

SKILL.md 有 frontmatter、版本、兼容性、凭据、监控、取消和失败模式,skill card 说明了所有者与 Apache 2.0;但缺少推荐的 Instructions 和 Examples 章节,benchmark 明确记录了这些结构问题,作者格式不规范,未见 changelog、维护责任人和明确更新路径,且仓库许可证元数据为 NOASSERTION,因此扣分。

有效结果6 / 15 · 2.0/5

对单节点 TAO Docker 任务提供了从预检到启动、监控和取消的可直接参考流程,并给出 SDK 与 docker run 两种路径;但只有一个正向评估任务,正确性约 47%/50%、效果约 60%,没有代表性实际输出或多种失败场景验证,仍需用户补充配置和审查,因此扣分。

证据核验4 / 10 · 2.0/5

存在修订固定的源文件、结构化配置、评估报告和一项 eval 定义,部分主张可审计;但评估样本仅 1 个、无负向任务,报告缺少可独立复现的执行产物,且没有覆盖核心 Docker/GPU/S3 路径的专属测试,因此静态证据仅支持有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • Docker 守护进程、远程 DOCKER_HOST、GPU、S3 凭据和 HOST_SSH_PATH 可能扩大主机或数据暴露面;执行前应逐项确认目标主机、挂载、镜像、凭据范围和 GPU。
  • 同一 job_id 的替换流程会停止并删除既有容器;应先确认不会影响其他任务,并保留可恢复的配置、日志和输出。
  • TAO_SKILL_BANK_ROOT 与 TAO_SKILL_BANK_PATH 的路径约定不一致,且关键依赖和镜像兼容性未由本次静态审查验证。
  • 中国大陆用户需单独验证 PyPI、NGC、远程 SSH 和 S3 endpoint 的可达性与合规性。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导代理使用配备 NVIDIA GPU 运行时的 Docker 守护进程执行 TAO SDK 作业。Docker 守护进程可以位于代理所在机器,也可以通过 DOCKER_HOST 连接远程 GPU 服务器。它覆盖运行前检查、数据路径与凭据验证、GPU 分配、容器监控、日志查看和取消作业。它适合开发、调试和小规模单节点任务,不适合远程集群调度、多节点训练或 SLURM 排队。

读取并检查 Docker 守护进程、NVIDIA 驱动、CUDA、NVIDIA Container Toolkit、GPU 可见性、GPU 占用、数据路径和模型凭据;运行 GPU smoke container;创建 Docker 网络;通过 Docker Python 客户端或直接 docker run 启动名为 tao-job-<job_id> 的 detached 容器;挂载 /dev/shm;映射容器状态并读取日志;停止容器以取消作业。可选的 TAO SDK 包装器提供 Job 句柄、S3 输入输出封装和 ActionWorkflow 持久性。

  1. 在配备 NVIDIA GPU 的开发机上运行 TAO 训练或推理容器,并检查运行时是否就绪。
  2. 在笔记本或工作站上提交任务到通过 DOCKER_HOST 暴露的远程单 GPU 服务器。
  3. 需要直接查看 Docker 容器状态和日志的 TAO 调试流程。
  4. 在单台主机上使用多个 GPU,通过 --gpus 或 gpu_count 分配资源。
  5. 需要 Job 句柄或 S3 输入输出自动下载与上传的 TAO SDK 工作流。

这个 Skill 有哪些优点和局限?

优点
  • 同时支持本机 Docker 和通过 DOCKER_HOST 连接的远程 Docker 主机。
  • 包含 GPU 运行时、数据路径、凭据、GPU 占用和架构兼容性检查。
  • 支持单主机多 GPU,并提供容器状态、日志和取消操作指导。
  • 可选 TAO SDK 提供 Job 句柄、S3 I/O 封装和跨会话持久性。
局限
  • 明确不支持多节点训练、远程集群调度和 SLURM 排队。
  • 依赖特定 NVIDIA 驱动、CUDA、Docker 和 NVIDIA Container Toolkit 版本。
  • 远程模式下规格中的本地文件路径实际由远程 Docker 主机解释。
  • 提供的材料没有记录该单项技能的测试套件或独立测试结果。

如何安装这个 Skill?

使用仓库 README 中的 skills CLI 安装指定技能:npx skills add nvidia/skills --skill tao-run-on-local-docker --yes。README 未说明该单项技能的其他手动安装步骤;安装后,代理下次加载技能并遇到相关任务时即可使用。

如何使用这个 Skill?

向代理提出“run locally”“local Docker”“remote Docker”或“use my GPU”等请求。运行前应执行主机预检:bash "$SETUP_SCRIPT" --backend docker --check-only,并确认 docker info 以及 docker run --rm --runtime=nvidia --gpus all ubuntu nvidia-smi 成功。远程 Docker 使用 DOCKER_HOST=ssh://user@host 或 Docker context,并将远程主机上的路径传给 remote-docker 预检。若使用 SDK,可安装 nvidia-tao-sdk[docker] 并通过 DockerSDK().create_job(...) 创建任务,再调用 get_job_status 和 get_job_logs。

这个 Skill 与同类方案有什么区别?

该技能将直接 docker run 与可选的 TAO SDK Docker 包装器并列说明:前者无需 TAO SDK,后者增加 Job 句柄、S3 I/O 和 ActionWorkflow 持久性。它还明确建议对 Lustre 等远程共享文件系统使用拥有该文件系统的平台,例如 SLURM。

常见问题

运行该技能需要哪些基础环境?
需要 NVIDIA 驱动分支 580、CUDA Toolkit 13.0、Docker 和 NVIDIA Container Toolkit 1.19.0;TAO SDK 的 docker extra 仅在需要 Job 句柄、S3 I/O 封装或 ActionWorkflow 持久性时才需要。
必须配置平台凭据吗?
除访问 Docker 守护进程外,没有必需的平台凭据。拉取私有 nvcr.io 镜像可能需要 NGC_KEY,使用 S3 数据则需要相应的访问密钥和路径配置。
为什么预检会阻止启动?
常见原因包括 Docker 守护进程不可达、GPU 运行时未配置、GPU 不可用、数据路径不存在、凭据缺失或容器镜像不支持主机 GPU 架构。
它能提交多节点或 SLURM 任务吗?
不能。该技能限定为单个 Docker 守护进程主机上的单节点执行。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA GPU Docker 运行规范

为 NVIDIA GPU 容器工作负载提供可复用的 Docker 运行、认证、挂载与故障排查规范。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 源码构建

在 Docker 容器中从源码构建 Holoscan SDK,并生成可供 CMake 使用的本地安装目录。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

相关 Skills