自动化与运维 ✓ NVIDIA · 官方 brevgpu-instancesdockertao-toolkitgpu-computes3-storagecli

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

FollowSkills 评估 · FSRS-2.0
不推荐
51/ 100 五分制 2.6 / 5
信任安全14 / 25 · 2.8/5

文档声明所需 CLI、登录状态和凭据,并限制为 Read/Bash;但 Bash 可执行远程创建、Docker、数据传输和删除实例,缺少逐步用户确认、最小权限范围及明确回滚方案;NGC 密钥示例通过 docker login 参数传递,可能暴露在进程或日志中,因此扣分。

可靠稳定8 / 20 · 2.0/5

预检、就绪轮询、超时建议和错误模式较具体,失败反馈通常可诊断;但未提供本技能路径的可执行测试,CLI/SDK 版本兼容性及引用的外部 skill、versions.yaml 和脚本未在选定路径证实,且实例供应、认证和命令语义存在环境依赖,因此限制在静态上限内并扣分。

适用触发10 / 15 · 3.3/5

触发短语、目标用户、TAO 训练/评估/推理场景以及单实例多 GPU、非多节点边界较清楚;但输入输出契约、非适用场景、中文支持和中国大陆网络可达性未充分说明,Brev、S3、NGC/Hugging Face 服务依赖可能造成环境限制。

规范维护9 / 15 · 3.0/5

结构包含前置检查、认证、生命周期、存储、Docker、清理和错误模式,且有 Apache-2.0、作者、版本和 skill card;但缺少推荐的 Instructions/Examples 部分,评估报告指出目录层级和作者格式问题,未见 changelog、维护责任人或明确更新路径,因此扣分。

有效结果6 / 15 · 2.0/5

文档覆盖从认证、实例准备到 TAO 容器运行和清理的核心流程,且提供可直接改写的命令;但仅有一个正向评估任务,正确性和发现性结果偏低,未有静态可验证的真实任务输出或对替代方案的充分比较,故仅给有限静态分。

证据核验4 / 10 · 2.0/5

存在固定修订、技能自身评估报告、评估任务和结果摘要,提供了一定可追溯性;但评估仅一个任务、无负向触发覆盖,未提供本技能专属测试套件或第三方独立复现证据,不能支持更高分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行 brev create、brev exec、Docker、S3 访问或 brev delete 前应明确获得用户确认,并确认实例、数据路径、费用和删除影响。
  • 不要将 NGC_KEY、BREV_API_TOKEN 或 S3 密钥直接放入命令行参数、日志或持久化脚本;应使用安全的非回显凭据机制。
  • 在中国大陆网络和目标云区域中先验证 Brev、NGC、S3 及 Hugging Face 的实际可达性,并核对 CLI/SDK 版本和外部引用是否存在。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导代理通过 Brev CLI 使用按需 GPU 实例运行 NVIDIA TAO 任务。它覆盖 CLI 和登录预检、实例创建与复用、Docker 运行、S3 数据流转以及实例清理。Brev 是实例型而非作业型平台,单实例支持多 GPU,但不支持多节点。使用它需要安装 brev CLI 并拥有有效的 Brev 登录。

检查 brev CLI、帮助命令和登录状态;在无交互环境中使用 BREV_API_TOKEN 登录;验证 GPU 实例、S3 凭据、模型凭据和数据路径;创建、复用、等待就绪并删除 Brev 实例;通过 brev exec 执行 Docker 和 TAO 命令;说明多 GPU、GPU 类型、存储、超时、NGC 登录及常见错误的处理方式。

  1. 需要在云端按需 GPU 实例上运行 TAO 训练的工程师,可用它完成实例启动、就绪检查和 Docker 作业执行。
  2. 在 CI、容器或无 TTY 的代理会话中提交 TAO 任务的团队,可按指导使用 BREV_API_TOKEN 避免交互式认证失败。
  3. 需要连续运行多个 TAO 作业的数据科学家,可复用同一实例以减少重复启动时间。
  4. 使用 S3 数据集或结果的用户,可在启动前验证 ACCESS_KEY、SECRET_KEY 和具体 S3 路径。
  5. 需要单实例多 GPU 训练的用户,可配置 gpu_count,并使用 torchrun 或 PyTorch DDP。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从认证、实例生命周期到 Docker 执行和清理的完整 Brev 工作流。
  • 针对无交互环境、实例 SSH 就绪延迟和冷启动超时提供了具体处理方法。
  • 支持单实例多 GPU,并允许通过 instance_id 复用实例。
  • 明确说明 S3 存储方式、多节点限制和常见失败模式。
局限
  • Brev 不支持跨实例多节点作业。
  • 实例启动约需 2–5 分钟,新实例首次 exec 可能需要等待,冷启动超时建议至少 600 秒。
  • 不支持共享 NFS/Lustre;删除实例后实例本地磁盘数据不会保留。
  • 技能本身不包含 brev CLI、云端 GPU、凭据或 TAO 容器镜像。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-run-on-brev --yes

README 未规定该技能的手动文件夹安装路径。

如何使用这个 Skill?

让兼容的代理处理类似“run on Brev”“Brev GPU instance”“submit job to Brev”或“Brev CLI deployment”的请求。开始前确保 brev CLI 已安装并登录;无交互环境先运行:

export BREV_API_TOKEN=...
brev login --token "$BREV_API_TOKEN"
brev ls --json

创建实例可使用:

brev create my-instance --gpu L40S:1

实例就绪后,通过 brev exec 运行 TAO Docker 命令,例如:

brev exec <instance> -- docker run --gpus all --rm -v ~/data:/data nvcr.io/nvidia/tao/tao-toolkit:6.26.3-pyt visual_changenet train -e /data/spec.yaml

完成后清理:

brev delete <instance>

若账户有多个云凭据或工作区组,创建时还需提供对应的 cloud credential ID 和 workspace group ID。

这个 Skill 与同类方案有什么区别?

与作业型平台不同,Brev 采用实例型工作流:先创建或复用实例,再通过 brev exec 运行命令,最后删除实例。它适合需要直接控制实例生命周期和 Docker 环境的 TAO 工作流,但不提供 Brev 上的多节点协调。

常见问题

运行该技能必须安装 TAO SDK 吗?
不必须。SKILL.md 明确说明,使用 brev exec docker run 即可;只有需要 Job handles、script_runner 的 S3 I/O 包装或状态持久化时才需要 TAO SDK。
无交互环境为什么会出现 auth EOF?
即使 BREV_API_TOKEN 已导出,brev ls 等命令仍可能尝试从 stdin 进行交互认证。应先运行 brev login --token "$BREV_API_TOKEN",失败时再刷新登录并重试。
Brev 支持多节点训练吗?
不支持。该技能说明 Brev 只能在一个实例上运行单个作业;单实例内可使用多 GPU。
数据和结果如何传输?
技能使用 S3,通过 script_runner 的 fsspec 集成传输数据和结果;使用 s3:// 路径时需要 ACCESS_KEY 和 SECRET_KEY。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA GPU Docker 运行规范

为 NVIDIA GPU 容器工作负载提供可复用的 Docker 运行、认证、挂载与故障排查规范。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

相关 Skills