自动化与运维 ✓ NVIDIA · 官方 nvidia-gpucudadockerkuberneteslinux-host-setupnvidia-container-toolkit

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

FollowSkills 评估 · FSRS-2.0
不推荐
55/ 100 五分制 2.8 / 5
信任安全18 / 25 · 3.6/5

文档明确区分只读检查与需用户批准的安装,并提供--yes、跳过Docker安装/配置/用户组及失败后复查说明;但安装需要sudo/root,会添加软件源、安装系统包、重启Docker,并默认将用户加入docker组,且没有自动回滚方案、完整变更预览或依赖来源校验,因此扣7分。

可靠稳定8 / 20 · 2.0/5

脚本使用严格错误模式,覆盖多种发行版、检查路径和若干失败提示,关键流程在静态上基本一致;但未执行验证,部分安装步骤使用|| true,驱动版本在RHEL/SUSE并非严格固定为580,且没有完整测试套件或恢复路径,因此受静态上限限制并扣2分。

适用触发10 / 15 · 3.3/5

目标用户、Docker/Kubernetes场景、支持的发行版、架构和不支持范围描述较清楚,检查路径可跨Linux使用;但依赖NVIDIA/Docker海外仓库和在线文档,未说明中国大陆网络可达性,也缺少更细的非适用边界与中文支持,因此扣5分。

规范维护8 / 15 · 2.7/5

具备结构化元数据、Apache-2.0许可、版本0.1.0、所有者和基准报告,并提供工作流、故障模式及参考资料;但缺少推荐的Instructions和Examples章节,作者格式不完整,没有明确changelog、维护责任和更新路径,且文档与脚本细节存在轻微不一致,因此扣7分。

有效结果7 / 15 · 2.3/5

技能直接提供检查、安装、Docker运行时配置和Kubernetes容量提示,输出命令可直接使用;但静态审查不能确认包名、仓库映射和最终运行结果,且基准只有1个任务、没有负向触发样本,因此按静态上限给7分并扣除结果完整性证据不足部分。

证据核验4 / 10 · 2.0/5

提交了脚本、评测任务、基准结果和静态验证发现,形成一定可审计链条;但只有单任务、单次评测,未提供覆盖关键安装路径的测试套件或独立复核,无法达到更高静态证据等级,因此扣1分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 安装会修改主机、可能重启Docker并授予docker组权限;仅在明确批准、可控主机和已有回滚计划下执行。
  • RHEL/SUSE路径描述为至少580而非严格580固定,需在目标发行版和驱动兼容性上额外确认。
  • 安装依赖NVIDIA及Docker在线仓库;中国大陆网络可达性、镜像替代和离线安装方案未说明。
  • 仓库源、包版本和安装结果未通过本次静态审查实际复现。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能用于在运行 TAO Docker、local-Docker 或 Kubernetes 后端前,检查 Linux GPU 主机的 NVIDIA 运行环境。经用户明确授权后,它可安装 NVIDIA 580 驱动、CUDA Toolkit 13.0 和 NVIDIA Container Toolkit 1.19.0,并按需安装和配置 Docker。检查模式只读且支持任意 Linux 发行版;安装模式自动支持 Debian、RHEL 和 SUSE 系列的指定版本。它适合需要标准化 TAO GPU 工作节点、但不希望代理未经许可修改系统的团队。

技能运行 Bash 配置脚本,读取发行版信息、内核和已安装软件状态,并检查 nvidia-smi、CUDA Toolkit、NVIDIA Container Toolkit 版本以及 Docker 的 NVIDIA runtime。使用 --check-only 时仅执行只读探测并输出缺失项。使用经用户授权的 --install 时,它会添加 NVIDIA CUDA 和 Container Toolkit 软件源,安装内核头文件或开发包、580 驱动、cuda-toolkit-13-0 和 Container Toolkit 1.19.0;对 Docker 后端可安装 Docker、配置 NVIDIA Docker runtime、启停 Docker,并将调用用户加入 docker 组。它还尝试加载 nvidia 内核模块,并输出后续验证命令、失败原因或不支持发行版的手动安装指导。

  1. TAO 用户准备 Ubuntu、Debian、Fedora、RHEL、Rocky、AlmaLinux、openSUSE 或 SLES GPU 主机,并希望一次性完成驱动、CUDA 与容器运行时配置。
  2. 平台工程师在提交 TAO Docker GPU 工作前,先以只读方式确认主机运行时是否满足要求。
  3. Kubernetes 管理员在安装 GPU Operator 或设备插件前,为每个自管 GPU worker 节点准备一致的主机运行时。
  4. 运维人员遇到 nvidia-smi、Docker NVIDIA runtime 或 Kubernetes GPU 可分配容量异常,需要获得具体缺失项和修复路径。

这个 Skill 有哪些优点和局限?

优点
  • 默认检查路径安全且只读,并支持任意 Linux 发行版。
  • 针对 Debian、RHEL 和 SUSE 系列提供自动化安装,版本目标和软件包选择明确。
  • 覆盖 Docker runtime 配置、用户组、内核模块和 Kubernetes GPU 容量检查。
  • 安装必须由用户明确授权,适合受控运维流程。
局限
  • 安装需要 sudo/root、互联网和 NVIDIA 软件源;Docker 后端可能还需要 Docker 软件源。
  • 自动化安装只覆盖文档列出的发行版和版本;Arch、Alpine、Gentoo、NixOS、FreeBSD 等需要手动安装。
  • RHEL 和 SUSE 系列使用 CUDA 13.0 软件源中的最新开放驱动,文档没有提供与 Debian 相同的严格 580 精确锁定。
  • 新加入 docker 组的权限不会立即作用于当前 shell,需要重新登录或运行 newgrp docker。
  • 提供的快速开始脚本路径与仓库顶层技能路径存在命名差异,部署时应核对实际安装目录。

如何安装这个 Skill?

使用仓库 README 中的 skills CLI 安装单个技能:

npx skills add nvidia/skills --skill tao-setup-nvidia-gpu-host --yes

也可以省略 --yes 以交互选择安装目标。README 说明该技能会在代理下次加载技能并遇到相关任务时可用。

如何使用这个 Skill?

先让代理执行只读检查,例如:“检查并准备这台主机用于 TAO Docker GPU 后端”,或“检查 TAO Kubernetes GPU worker runtime”。技能文档给出的检查命令是:

bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend docker --check-only

Kubernetes 节点可将 backend 改为 kubernetes。检查失败时,代理应说明缺失项并请求授权;获得授权后,安装命令使用 --install,非交互运行还要追加 --yes:

bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend docker --install --yes

安装后重新运行 --check-only,并按文档验证 nvidia-smi、CUDA 13.0、Docker runtime 和容器内 GPU。

常见问题

它会在没有授权的情况下安装驱动或修改主机吗?
不会。--check-only 默认只读;安装必须显式使用 --install,并在代理的非交互运行中追加 --yes。
哪些系统可以自动安装?
支持 Ubuntu 22.04/24.04、Debian 12、Fedora 39+、RHEL/Rocky/AlmaLinux 9/10,以及 openSUSE Leap 15 和 SLES 15。其他系统会获得手动安装指导。
它是否会安装 Docker?
仅针对 docker 或 local-docker 后端,并且仅在 Docker 缺失时默认安装。可使用 --skip-docker-install 或预先自行管理 Docker。
Kubernetes 节点还需要 GPU Operator 吗?
自管集群通常仍需在主机运行时准备好后安装 NVIDIA GPU Operator 或设备插件;托管 Kubernetes 可能由节点镜像或平台策略管理驱动。

同仓库的其他 Skills

均来自 NVIDIA/skills

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 源码构建

在 Docker 容器中从源码构建 Holoscan SDK,并生成可供 CMake 使用的本地安装目录。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA GPU Docker 运行规范

为 NVIDIA GPU 容器工作负载提供可复用的 Docker 运行、认证、挂载与故障排查规范。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 安装向导

根据主机环境选择并引导完成 Holoscan SDK 的合适安装方式。

开发与工程 ✓ NVIDIA · 官方

Holoscan Ubuntu 原生安装助手

在 Ubuntu 上通过 NVIDIA apt 仓库安装并验证 Holoscan SDK C++ 环境。

自动化与运维 ✓ NVIDIA · 官方

cuOpt 安装助手

指导在 Python、C 或 REST 服务中安装并验证 NVIDIA cuOpt。

开发与工程 ✓ NVIDIA · 官方

Holoscan Python Wheel 安装助手

在 Linux NVIDIA GPU 环境中,将 Holoscan SDK Python 绑定安装到虚拟环境并完成基础验证。

数据与分析 ✓ NVIDIA · 官方

TAO AOI 图像挖掘

使用统一图像编码器嵌入目标与源图像,并挖掘用于增强训练的近邻 AOI 图像。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

自动化与运维 ✓ NVIDIA · 官方

VSS 多摄像头三维检测追踪部署

部署基于 DeepStream 与 BEV Fusion 的多摄像头三维感知服务。

开发与工程 ✓ NVIDIA · 官方

NVIDIA 技能发现器

帮助代理在 NVIDIA 产品与工作流中发现并选择合适的技能。

开发与工程 ✓ NVIDIA · 官方

Holoscan Conda 安装助手

在 Linux x86_64 的 CUDA 13 环境中,通过 Conda 安装并验证 Holoscan SDK。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

开发与工程 ✓ NVIDIA · 官方

导管导航设置验证

验证导管导航工作流的主机、GPU与Python路径配置。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

自动化与运维 ✓ NVIDIA · 官方

Dynamo 配方部署助手

在 Kubernetes 上选择、校验、修补并部署现有的 NVIDIA Dynamo 推理配方。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

相关 Skills