TAO 平台执行 SDK
在多种 GPU 平台上提交、监控并管理 NVIDIA TAO 训练任务。
文档限制凭据读取为环境变量存在性检查,按平台筛选凭据,并说明 S3/HF/NGC 数据流、输出位置、取消和实例清理方式;但允许默认自动安装未锁定的 nvidia-tao-sdk[all],会产生网络与供应链外部影响,启动 GPU 作业前也缺少明确的最终执行确认,因此扣分。
核心 API、平台差异、轮询、错误模式和异常反馈说明较完整;但依赖版本未固定,关键 helper、skill_info.yaml、脚本和 SDK 实现不在选定技能证据中,且未提供覆盖关键路径的测试,因此按静态上限保守扣分。
目标用户、触发词、平台选择、监控偏好、非支持范围和本地 Docker 多节点限制较清楚;但没有中文使用指导,也未说明中国大陆网络、镜像仓库、PyPI、S3/HF/NGC 可达性,环境适配证据有限,因此扣分。
信息分层较好,具有前置检查、参考文档、错误模式、范围边界、示例、Apache-2.0 许可证、版本 0.1.0 和 NVIDIA 维护归属;但缺少推荐的 Instructions/Examples 章节,版本变更记录与明确更新流程不足,依赖安装假设也较隐蔽,因此扣分。
技能覆盖提交、监控、日志、S3 I/O、多节点和多平台作业,理论上能直接支持复杂 TAO 工作流;但静态材料没有验证真实作业输出,基准仅含一个计划说明任务,且自动安装和平台前置条件可能带来较高成本,因此不超过静态上限并扣分。
存在提交的 evals.json、BENCHMARK.md、错误映射和具体代码示例,提供一定审计线索;但只有一个评测任务、无负向任务或提交的关键路径测试,基准结果主要是报告性证据,无法独立复现完整结论,因此扣分。
- 执行前应人工确认平台、镜像、凭据范围、数据 URI、输出持久化位置、GPU/云资源成本以及是否允许自动安装依赖。
- 应锁定并审查 nvidia-tao-sdk[all] 及其平台依赖版本,并验证当前环境能访问所需包索引、容器注册表、S3、HF Hub 或 NGC。
- 不要把本地路径直接用于 SLURM 或 Kubernetes;作业启动后应确认输出已持久化,而不是依赖容器临时目录。
- 基准仅覆盖一个正向说明任务,不能证明真实 TAO 作业的正确性、可靠性或安全性。
这个 Skill 能做什么,适合哪些场景?
该技能为 NVIDIA TAO Execution SDK 提供平台执行指导,适用于 Brev、SLURM、本地 Docker 和 Kubernetes。它帮助代理创建带有 Job 句柄的任务,轮询状态、读取日志、分析失败原因并获取结果目录。SDK 还可封装 S3 输入下载与输出上传,并支持多节点训练和平台特有功能。它适合需要持久化任务状态或长期监控的 TAO 用户,而不是只需直接使用 docker run 的简单场景。
检查并安装 Python 依赖 nvidia-tao-sdk[all];读取环境变量是否存在但不读取凭据值;根据选定平台获取所需凭据;使用 build_entrypoint 构造容器命令;调用 SDK 创建、查询、取消任务并读取日志、失败分析和结果目录;为声明的输入执行 S3、HF Hub 或 NGC 下载,并在运行结束后上传输出;支持 Brev 实例查询与删除,以及 S3、Lustre、PVC、bind 或 NFS 结果路径。
- 需要在 Brev GPU 实例上运行 TAO 训练并持续查看状态的用户。
- 需要通过 SLURM 和 Lustre 队列提交多节点分布式训练的团队。
- 需要让任务自动下载 S3 输入并上传训练结果的工程师。
- 需要在 Kubernetes Jobs 或本地 Docker 中调试 TAO 容器的开发者。
- 需要串联多个 TAO 任务并保存 job.id 和状态文件的用户。
这个 Skill 有哪些优点和局限?
- 统一覆盖 Brev、SLURM、本地 Docker 和 Kubernetes。
- 提供任务句柄、状态轮询、日志读取、失败分析和取消操作。
- 内置 S3 输入下载与输出上传流程。
- 支持持久化 job.id 和状态文件,便于重新连接后台任务。
- 明确区分平台凭据,并避免读取凭据实际值。
- 依赖 Python 3.10+、nvidia-tao-sdk[all] 和可用的 pip 配置。
- 平台、S3 和容器环境可能需要额外环境变量或登录凭据。
- 若没有持久化挂载或 S3,结果只能保存在容器临时目录中。
- 监控需要保持聊天或运行时打开;无法长期保持时必须改为手动刷新。
- 源码未提供该技能自身的测试套件或各平台的独立测试证据。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-run-platform --yes
技能将在代理下次加载技能并遇到相关任务时可用。运行技能前需安装依赖:
python -m pip install "nvidia-tao-sdk[all]"
README 未说明该技能单独发布包的费用。
如何使用这个 Skill?
向代理提出“use the TAO SDK”或“TAO platform run”,并说明要运行的 TAO 工作流。启动前选择 Brev、SLURM、本地 Docker 或 Kubernetes,确认是否持续监控以及状态更新间隔;默认监控开启、间隔为 5 分钟。随后确认默认容器镜像或提供 image=<override>,再按所选平台提供需要的环境变量。代理使用 SDK 创建任务并持续查询,直到任务完成、失败、取消,或用户要求停止监控。
这个 Skill 与同类方案有什么区别?
相较于直接使用 docker run,该技能适合需要 Job 句柄、长期监控、S3 I/O 封装、平台队列或多任务编排的场景;简单的 TAO 运行通常不需要 SDK。