TAO Brev GPU 运行技能
在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。
文档声明所需 CLI、登录状态和凭据,并限制为 Read/Bash;但 Bash 可执行远程创建、Docker、数据传输和删除实例,缺少逐步用户确认、最小权限范围及明确回滚方案;NGC 密钥示例通过 docker login 参数传递,可能暴露在进程或日志中,因此扣分。
预检、就绪轮询、超时建议和错误模式较具体,失败反馈通常可诊断;但未提供本技能路径的可执行测试,CLI/SDK 版本兼容性及引用的外部 skill、versions.yaml 和脚本未在选定路径证实,且实例供应、认证和命令语义存在环境依赖,因此限制在静态上限内并扣分。
触发短语、目标用户、TAO 训练/评估/推理场景以及单实例多 GPU、非多节点边界较清楚;但输入输出契约、非适用场景、中文支持和中国大陆网络可达性未充分说明,Brev、S3、NGC/Hugging Face 服务依赖可能造成环境限制。
结构包含前置检查、认证、生命周期、存储、Docker、清理和错误模式,且有 Apache-2.0、作者、版本和 skill card;但缺少推荐的 Instructions/Examples 部分,评估报告指出目录层级和作者格式问题,未见 changelog、维护责任人或明确更新路径,因此扣分。
文档覆盖从认证、实例准备到 TAO 容器运行和清理的核心流程,且提供可直接改写的命令;但仅有一个正向评估任务,正确性和发现性结果偏低,未有静态可验证的真实任务输出或对替代方案的充分比较,故仅给有限静态分。
存在固定修订、技能自身评估报告、评估任务和结果摘要,提供了一定可追溯性;但评估仅一个任务、无负向触发覆盖,未提供本技能专属测试套件或第三方独立复现证据,不能支持更高分。
- 执行 brev create、brev exec、Docker、S3 访问或 brev delete 前应明确获得用户确认,并确认实例、数据路径、费用和删除影响。
- 不要将 NGC_KEY、BREV_API_TOKEN 或 S3 密钥直接放入命令行参数、日志或持久化脚本;应使用安全的非回显凭据机制。
- 在中国大陆网络和目标云区域中先验证 Brev、NGC、S3 及 Hugging Face 的实际可达性,并核对 CLI/SDK 版本和外部引用是否存在。
这个 Skill 能做什么,适合哪些场景?
该技能指导代理通过 Brev CLI 使用按需 GPU 实例运行 NVIDIA TAO 任务。它覆盖 CLI 和登录预检、实例创建与复用、Docker 运行、S3 数据流转以及实例清理。Brev 是实例型而非作业型平台,单实例支持多 GPU,但不支持多节点。使用它需要安装 brev CLI 并拥有有效的 Brev 登录。
检查 brev CLI、帮助命令和登录状态;在无交互环境中使用 BREV_API_TOKEN 登录;验证 GPU 实例、S3 凭据、模型凭据和数据路径;创建、复用、等待就绪并删除 Brev 实例;通过 brev exec 执行 Docker 和 TAO 命令;说明多 GPU、GPU 类型、存储、超时、NGC 登录及常见错误的处理方式。
- 需要在云端按需 GPU 实例上运行 TAO 训练的工程师,可用它完成实例启动、就绪检查和 Docker 作业执行。
- 在 CI、容器或无 TTY 的代理会话中提交 TAO 任务的团队,可按指导使用 BREV_API_TOKEN 避免交互式认证失败。
- 需要连续运行多个 TAO 作业的数据科学家,可复用同一实例以减少重复启动时间。
- 使用 S3 数据集或结果的用户,可在启动前验证 ACCESS_KEY、SECRET_KEY 和具体 S3 路径。
- 需要单实例多 GPU 训练的用户,可配置 gpu_count,并使用 torchrun 或 PyTorch DDP。
这个 Skill 有哪些优点和局限?
- 覆盖从认证、实例生命周期到 Docker 执行和清理的完整 Brev 工作流。
- 针对无交互环境、实例 SSH 就绪延迟和冷启动超时提供了具体处理方法。
- 支持单实例多 GPU,并允许通过 instance_id 复用实例。
- 明确说明 S3 存储方式、多节点限制和常见失败模式。
- Brev 不支持跨实例多节点作业。
- 实例启动约需 2–5 分钟,新实例首次 exec 可能需要等待,冷启动超时建议至少 600 秒。
- 不支持共享 NFS/Lustre;删除实例后实例本地磁盘数据不会保留。
- 技能本身不包含 brev CLI、云端 GPU、凭据或 TAO 容器镜像。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-run-on-brev --yes
README 未规定该技能的手动文件夹安装路径。
如何使用这个 Skill?
让兼容的代理处理类似“run on Brev”“Brev GPU instance”“submit job to Brev”或“Brev CLI deployment”的请求。开始前确保 brev CLI 已安装并登录;无交互环境先运行:
export BREV_API_TOKEN=...
brev login --token "$BREV_API_TOKEN"
brev ls --json
创建实例可使用:
brev create my-instance --gpu L40S:1
实例就绪后,通过 brev exec 运行 TAO Docker 命令,例如:
brev exec <instance> -- docker run --gpus all --rm -v ~/data:/data nvcr.io/nvidia/tao/tao-toolkit:6.26.3-pyt visual_changenet train -e /data/spec.yaml
完成后清理:
brev delete <instance>
若账户有多个云凭据或工作区组,创建时还需提供对应的 cloud credential ID 和 workspace group ID。
这个 Skill 与同类方案有什么区别?
与作业型平台不同,Brev 采用实例型工作流:先创建或复用实例,再通过 brev exec 运行命令,最后删除实例。它适合需要直接控制实例生命周期和 Docker 环境的 TAO 工作流,但不提供 Brev 上的多节点协调。