TAO 标准训练流程
为 TAO 模型执行标准的训练、评估与导出流程。
文档要求确认容器镜像、选择平台,并仅索取相关凭据,且声明 Docker/NVIDIA Container Toolkit 依赖;这支持一定的最小权限、用户确认和数据流透明性。扣分在于 allowed-tools 包含宽泛的 Bash/Write,未说明凭据如何处理、数据如何流向外部平台、失败后的回滚或训练产物清理,也未给出更细的隔离边界。
步骤、前置条件和 AutoML 路由大体一致,并要求解析模型元数据和镜像;但“标准单步训练”默认可能路由到 AutoML,且依赖其他模型技能、外部脚本和平台配置,未提供关键路径测试、异常输入处理或可诊断失败反馈。静态评估不超过10分,因此为7分。
触发短语、训练/评估/导出场景、必需输入、可选输入和支持平台均有说明,也声明不适用于数据增强、AutoML/DEFT 循环的普通路径。扣分在于非适用边界仍不完整,模型能力依赖其他技能,未说明中文交互支持;依赖 Docker、NVIDIA 容器工具链及可能的外部平台,未证明中国大陆网络环境下的可达性。
具有 frontmatter、Apache-2.0 许可、作者、版本、标签、skill_info 和 benchmark,并有维护来源线索。扣分在于缺少独立的 Instructions、Examples、FAQ、已知限制、变更日志和明确更新责任;benchmark 还记录了目录层级和作者格式等规范问题,安装说明主要位于共享仓库文档而非技能本身。
文档能直接指导用户收集模型、数据集、平台、镜像和监控选项,并定义 train/eval/export 流程;提交的单项 benchmark 报告显示有效性较高但样本极少。扣分在于真正执行需要外部模型技能、脚本、平台和凭据,输出格式及代表性结果未在本技能文件中验证,用户仍可能需要较多环境适配。静态评估不超过7分,因此为6分。
存在固定版本、结构化 skill_info、评估任务和 NVSkills-Eval 报告,提供了有限的可审计依据。扣分在于仅1个任务、每个代理1次尝试、无负向触发样本,且评估相关测试并非该技能关键路径的提交测试;静态阅读无法独立复现执行结论,因此不超过5分。
- 执行前应核实所选模型技能、平台脚本、容器镜像和凭据要求是否实际存在并与当前版本兼容。
- 不要向代理授予超出训练所需范围的 Bash/Write 权限;训练前应明确数据上传、日志、检查点和导出物的外部流向及保留策略。
- 应补充失败恢复、取消训练、清理和回滚步骤,并在中国大陆网络环境中验证所需镜像、平台和存储服务的可达性。
这个 Skill 能做什么,适合哪些场景?
这是 NVIDIA TAO Toolkit 的通用单步训练技能,适用于使用标注数据进行一次常规训练。它按需执行训练、评估和模型导出,并支持通过 AutoML 或关闭 AutoML 的普通训练路径。技能会先收集平台、数据集、凭据和容器镜像信息,再路由到具体模型技能及 TAO 工作流。它不覆盖迭代式数据增强、AutoML 循环或 DEFT 流程。
要求用户提供兼容的 TAO 模型和训练数据集 URI,收集受支持的平台选择,并根据模型元数据判断是否默认使用 AutoML。它解析训练容器镜像并要求用户确认或提供镜像覆盖值,调用平台列表、模型元数据和镜像解析脚本,随后路由到具体模型技能及 tao-launch-workflow。训练完成后,在解析到评估数据集时执行评估,并可按用户请求导出模型。
- 需要将带标签的数据用于一次普通 TAO 模型训练的视觉 AI 开发者。
- 希望执行“训练后评估再导出”流程、但不使用迭代循环的工程师。
- 明确要求关闭 AutoML、只运行一次训练任务的用户。
- 需要在本地 Docker、Slurm、Kubernetes 或其他受支持 TAO 平台上启动训练的用户。
这个 Skill 有哪些优点和局限?
- 覆盖通用的训练、评估和可选导出顺序。
- 能根据模型元数据在 AutoML 与普通训练路径之间进行路由。
- 在提交训练前要求确认容器镜像,并收集平台相关凭据。
- 支持通过平台与模型技能扩展具体操作。
- 依赖 Docker 和 nvidia-container-toolkit,以及具体工作流声明的额外要求。
- 必须先确定受支持的平台并确认容器镜像,不能直接无交互提交。
- 具体模型参数和动作由其他模型技能提供,本技能本身不是完整的模型配置指南。
- 源材料未提供独立测试套件或各平台成功率证据。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装指定技能:npx skills add nvidia/skills --skill tao-train-single-step --yes。README 未说明单独复制该技能目录所需的其他步骤。
如何使用这个 Skill?
向已加载该技能的代理提出“执行一次普通 TAO 训练,然后评估并导出”或“运行 plain TAO training,关闭 AutoML”。随后提供模型、训练数据集 URI、目标平台和必要凭据;确认解析出的默认容器镜像,或指定 image=<override>。若需要评估,提供 eval_dataset_uri;如需从指定权重开始,提供 base_checkpoint。