自动化与运维 ✓ NVIDIA · 官方 dockernvidia-gpungc-authenticationcontainer-toolkitgpu-workloadscontainer-debuggingdocker-storage

NVIDIA GPU Docker 运行规范

为 NVIDIA GPU 容器工作负载提供可复用的 Docker 运行、认证、挂载与故障排查规范。

FollowSkills 评估 · FSRS-2.0
不推荐
45/ 100 五分制 2.3 / 5
信任安全13 / 25 · 2.6/5

文档说明了使用环境变量传递凭据、避免将秘密放在命令行中,并要求用户批准主机安装;但允许工具包含 Bash,且给出了 docker system prune、sudo 移动/删除 Docker 数据目录、停止并删除容器等高影响操作,未普遍要求确认、备份或回滚。凭据会持久化到 ~/.docker/config.json,数据流和敏感信息清理说明仍不完整,因此扣分。

可靠稳定5 / 20 · 1.3/5

内容覆盖常见路径和错误诊断,但静态检查发现 canonical docker run 示例中反斜杠后带有空格再接注释,可能导致 shell 续行失效;ubuntu 镜像示例也未证明包含 nvidia-smi。依赖 tao-setup-nvidia-gpu-host 的路径和版本要求较脆弱,且无覆盖本技能关键路径的提交测试,因此按静态上限保守扣分。

适用触发9 / 15 · 3.0/5

触发词、目标用户和 Docker GPU 场景边界较清楚,也明确区分平台层、模型层和数据层职责;但固定要求驱动 580、CUDA 13.0 和 Toolkit 1.19.0,可能排除大量环境,未说明非兼容版本策略或中文使用支持。NGC、Hugging Face、S3 和 W&B 等外部服务可能受中国大陆网络可达性影响,因此扣分。

规范维护8 / 15 · 2.7/5

文档有前置条件、认证、运行、挂载、检查、网络、磁盘和错误模式等分层内容,并提供 Apache-2.0、版本和 skill card;但缺少明确的 Instructions/Examples 章节、变更日志、维护责任与更新路径,benchmark 还报告了 tags 放置、层级和作者格式问题,故未给满分。

有效结果6 / 15 · 2.0/5

该技能能为 NVIDIA GPU Docker 工作负载提供可直接改写的命令模板、挂载和故障排查建议,核心价值明确;但它不选择镜像或业务命令,示例存在可执行性疑点,危险操作需要人工复核,且静态审查无法验证实际结果,因此按上限保守给分。

证据核验4 / 10 · 2.0/5

文档引用 Docker 和 NVIDIA 官方资料,并附有一次外部评估报告及评测任务;但评测仅有一个计划描述任务、没有负向触发覆盖,也没有针对本技能关键路径的提交测试或多源复现证据。静态审查不能视为独立执行验证,因此扣分。

证据充分度: 评估于 2026年7月29日 审查版本 ce70ca7f1966
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应修正并验证带注释的反斜杠续行示例,并确认测试镜像实际包含 nvidia-smi。
  • docker system prune -a --volumes、sudo 数据目录迁移/删除以及 stop/rm 操作应增加明确用户确认、备份和可逆恢复步骤。
  • NGC/Hugging Face 等外部服务和固定版本依赖可能造成中国大陆网络或环境兼容性问题。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向需要在 NVIDIA GPU 主机上运行 Docker 容器的 AI 代理。它覆盖 NGC 登录、GPU 分配、共享内存、数据与结果挂载、环境变量传递、容器检查和镜像存储迁移。它还总结了 GPU 驱动、认证、磁盘空间、权限和容器启动失败等常见问题。技能只负责“如何运行”容器,具体镜像和命令由其他模型或数据技能指定。

读取并检查 Docker 版本、GPU 主机运行时和 NGC_KEY;调用 docker login、docker pull、docker run、docker exec、docker inspect、docker logs、docker stats 等命令;使用 --gpus、--shm-size、卷挂载、环境变量和网络配置启动或管理容器;指导将 Docker data-root 从根卷迁移到较大磁盘;根据 GPU 驱动、认证、磁盘、共享内存、权限或容器退出错误给出排查路径。

  1. AI 工程师需要从 nvcr.io 拉取 NVIDIA 容器并在 GPU 主机上运行训练或推理任务时。
  2. 多 GPU 训练因默认 /dev/shm 太小而出现 Bus error 时。
  3. 工作主机根磁盘较小、大型 NVIDIA 镜像可能占满空间,且需要迁移 Docker 数据目录时。
  4. 代理需要在同一容器中执行下载、运行和后处理多个步骤时。
  5. 运维人员需要检查容器挂载、环境变量、命令、网络状态或退出码时。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从 NGC 认证到容器清理、检查和故障排查的完整 Docker 运行流程。
  • 给出可复制的命令模式,包含 GPU、挂载、共享内存和环境变量处理。
  • 明确区分宿主机路径与容器内路径,并提供分盘主机的 data-root 迁移方案。
  • 范围边界清晰,可作为其他模型和数据技能的 Docker 执行层。
局限
  • 要求特定的 NVIDIA 驱动、CUDA Toolkit、Docker 和 NVIDIA Container Toolkit 版本。
  • 依赖 NGC API key 及网络连接才能拉取 nvcr.io 镜像。
  • 部分示例包含 sudo、rsync 和删除旧 Docker 数据目录等高权限或破坏性操作。
  • SKILL.md 未提供测试套件或平台覆盖证据。

如何安装这个 Skill?

使用仓库 README 中的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-run-on-docker --yes

README 未说明该技能的手动复制目标路径;安装后,代理在加载技能并遇到相关任务时使用它。

如何使用这个 Skill?

在已安装该技能的代理中提出包含相关运行场景的请求,例如:“在 NVIDIA GPU 主机上运行一个 nvcr.io 容器,使用 GPU 0 和 1、挂载数据目录,并排查共享内存问题。”技能会在涉及 docker、docker run、nvcr.io、NGC、--gpus 或 nvidia-container-toolkit 时提供运行规范。具体镜像和业务命令需要由调用技能提供。

这个 Skill 与同类方案有什么区别?

与 tao-run-on-brev、tao-run-platform 等相邻技能相比,本技能聚焦通用 GPU 主机上的 Docker 运行方式;tao-run-on-brev 处理通过 brev exec 访问主机,tao-run-platform 则提供 Job、状态持久化和 S3 I/O 等额外封装。

常见问题

这个技能会选择要运行的模型镜像和业务命令吗?
不会。模型和数据技能负责指定镜像与命令,本技能负责 Docker GPU 运行规范。
必须使用 NGC API key 吗?
拉取 nvcr.io/* 镜像需要 NGC API key;技能示例通过 NGC_KEY 执行 docker login。
出现 GPU 驱动选择错误怎么办?
检查 NVIDIA Container Toolkit 是否安装并正确配置 Docker;技能建议使用 tao-setup-nvidia-gpu-host,在用户批准后执行安装流程。
技能适合 Jetson 或其他非标准主机吗?
技能偏好标准 x86 主机上的 --gpus;它说明 Tegra/Jetson 可能使用 NVIDIA_VISIBLE_DEVICES 和 NVIDIA_DRIVER_CAPABILITIES 环境变量,但没有提供完整的平台安装指南。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 源码构建

在 Docker 容器中从源码构建 Holoscan SDK,并生成可供 CMake 使用的本地安装目录。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

开发与工程 ✓ NVIDIA · 官方

DOCA 调试

帮助定位并分层排查 NVIDIA DOCA 的构建、链接、运行时与程序问题。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

Hugging Face 本地 GPU 微调助手

在本地 NVIDIA GPU 上,以可复现流程微调 Hugging Face 模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 安装向导

根据主机环境选择并引导完成 Holoscan SDK 的合适安装方式。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

自动化与运维 ✓ NVIDIA · 官方

Nemotron Speech 语音 NIM 技能

指导部署和运行 NVIDIA Riva 的语音识别、语音合成与翻译 NIM。

开发与工程 ✓ NVIDIA · 官方

DeepStream 管道构建器

通过交互式需求收集,为 NVIDIA DeepStream 生成并验证可运行的 GStreamer 推理管道。

自动化与运维 ✓ NVIDIA · 官方

VIOS 视频输入输出与存储管理

通过 VIOS REST API 管理传感器、视频流、录制、快照和视频存储。

开发与工程 ✓ NVIDIA · 官方

Holoscan Conda 安装助手

在 Linux x86_64 的 CUDA 13 环境中,通过 Conda 安装并验证 Holoscan SDK。

相关 Skills