TAO NVIDIA GPU 主机配置
为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。
文档明确区分只读检查与需用户批准的安装,并提供--yes、跳过Docker安装/配置/用户组及失败后复查说明;但安装需要sudo/root,会添加软件源、安装系统包、重启Docker,并默认将用户加入docker组,且没有自动回滚方案、完整变更预览或依赖来源校验,因此扣7分。
脚本使用严格错误模式,覆盖多种发行版、检查路径和若干失败提示,关键流程在静态上基本一致;但未执行验证,部分安装步骤使用|| true,驱动版本在RHEL/SUSE并非严格固定为580,且没有完整测试套件或恢复路径,因此受静态上限限制并扣2分。
目标用户、Docker/Kubernetes场景、支持的发行版、架构和不支持范围描述较清楚,检查路径可跨Linux使用;但依赖NVIDIA/Docker海外仓库和在线文档,未说明中国大陆网络可达性,也缺少更细的非适用边界与中文支持,因此扣5分。
具备结构化元数据、Apache-2.0许可、版本0.1.0、所有者和基准报告,并提供工作流、故障模式及参考资料;但缺少推荐的Instructions和Examples章节,作者格式不完整,没有明确changelog、维护责任和更新路径,且文档与脚本细节存在轻微不一致,因此扣7分。
技能直接提供检查、安装、Docker运行时配置和Kubernetes容量提示,输出命令可直接使用;但静态审查不能确认包名、仓库映射和最终运行结果,且基准只有1个任务、没有负向触发样本,因此按静态上限给7分并扣除结果完整性证据不足部分。
提交了脚本、评测任务、基准结果和静态验证发现,形成一定可审计链条;但只有单任务、单次评测,未提供覆盖关键安装路径的测试套件或独立复核,无法达到更高静态证据等级,因此扣1分。
- 安装会修改主机、可能重启Docker并授予docker组权限;仅在明确批准、可控主机和已有回滚计划下执行。
- RHEL/SUSE路径描述为至少580而非严格580固定,需在目标发行版和驱动兼容性上额外确认。
- 安装依赖NVIDIA及Docker在线仓库;中国大陆网络可达性、镜像替代和离线安装方案未说明。
- 仓库源、包版本和安装结果未通过本次静态审查实际复现。
这个 Skill 能做什么,适合哪些场景?
该技能用于在运行 TAO Docker、local-Docker 或 Kubernetes 后端前,检查 Linux GPU 主机的 NVIDIA 运行环境。经用户明确授权后,它可安装 NVIDIA 580 驱动、CUDA Toolkit 13.0 和 NVIDIA Container Toolkit 1.19.0,并按需安装和配置 Docker。检查模式只读且支持任意 Linux 发行版;安装模式自动支持 Debian、RHEL 和 SUSE 系列的指定版本。它适合需要标准化 TAO GPU 工作节点、但不希望代理未经许可修改系统的团队。
技能运行 Bash 配置脚本,读取发行版信息、内核和已安装软件状态,并检查 nvidia-smi、CUDA Toolkit、NVIDIA Container Toolkit 版本以及 Docker 的 NVIDIA runtime。使用 --check-only 时仅执行只读探测并输出缺失项。使用经用户授权的 --install 时,它会添加 NVIDIA CUDA 和 Container Toolkit 软件源,安装内核头文件或开发包、580 驱动、cuda-toolkit-13-0 和 Container Toolkit 1.19.0;对 Docker 后端可安装 Docker、配置 NVIDIA Docker runtime、启停 Docker,并将调用用户加入 docker 组。它还尝试加载 nvidia 内核模块,并输出后续验证命令、失败原因或不支持发行版的手动安装指导。
- TAO 用户准备 Ubuntu、Debian、Fedora、RHEL、Rocky、AlmaLinux、openSUSE 或 SLES GPU 主机,并希望一次性完成驱动、CUDA 与容器运行时配置。
- 平台工程师在提交 TAO Docker GPU 工作前,先以只读方式确认主机运行时是否满足要求。
- Kubernetes 管理员在安装 GPU Operator 或设备插件前,为每个自管 GPU worker 节点准备一致的主机运行时。
- 运维人员遇到 nvidia-smi、Docker NVIDIA runtime 或 Kubernetes GPU 可分配容量异常,需要获得具体缺失项和修复路径。
这个 Skill 有哪些优点和局限?
- 默认检查路径安全且只读,并支持任意 Linux 发行版。
- 针对 Debian、RHEL 和 SUSE 系列提供自动化安装,版本目标和软件包选择明确。
- 覆盖 Docker runtime 配置、用户组、内核模块和 Kubernetes GPU 容量检查。
- 安装必须由用户明确授权,适合受控运维流程。
- 安装需要 sudo/root、互联网和 NVIDIA 软件源;Docker 后端可能还需要 Docker 软件源。
- 自动化安装只覆盖文档列出的发行版和版本;Arch、Alpine、Gentoo、NixOS、FreeBSD 等需要手动安装。
- RHEL 和 SUSE 系列使用 CUDA 13.0 软件源中的最新开放驱动,文档没有提供与 Debian 相同的严格 580 精确锁定。
- 新加入 docker 组的权限不会立即作用于当前 shell,需要重新登录或运行 newgrp docker。
- 提供的快速开始脚本路径与仓库顶层技能路径存在命名差异,部署时应核对实际安装目录。
如何安装这个 Skill?
使用仓库 README 中的 skills CLI 安装单个技能:
npx skills add nvidia/skills --skill tao-setup-nvidia-gpu-host --yes
也可以省略 --yes 以交互选择安装目标。README 说明该技能会在代理下次加载技能并遇到相关任务时可用。
如何使用这个 Skill?
先让代理执行只读检查,例如:“检查并准备这台主机用于 TAO Docker GPU 后端”,或“检查 TAO Kubernetes GPU worker runtime”。技能文档给出的检查命令是:
bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend docker --check-only
Kubernetes 节点可将 backend 改为 kubernetes。检查失败时,代理应说明缺失项并请求授权;获得授权后,安装命令使用 --install,非交互运行还要追加 --yes:
bash skills/platform/tao-setup-nvidia-gpu-host/scripts/setup-nvidia-gpu-host.sh --backend docker --install --yes
安装后重新运行 --check-only,并按文档验证 nvidia-smi、CUDA 13.0、Docker runtime 和容器内 GPU。