TAO 工作流启动门禁
在执行 TAO 作业前完成平台、凭证、数据与容器预检。
技能明确要求平台、凭据、镜像、数据集、计算资源和最终启动审查,并要求用户确认;凭据只验证存在性且禁止打印秘密,权限声明为 Read/Bash。扣4分:Bash和远程平台仍可产生广泛外部副作用,未定义通用回滚或取消已提交作业的流程,数据流和敏感数据处理说明也不完整。
文档对多平台预检、失败后重试、依赖修复、SLURM/ Docker/远程存储边界和监控终态有较一致的规则。扣2分:依赖脚本、模型技能和平台实现不在选定技能目录中,静态材料无法确认可用性、接口一致性或关键路径可运行;没有针对本技能的测试套件。
触发条件覆盖TAO的训练、评估、推理、导出、TensorRT、AutoML和DEFT,并明确平台选择、根路径/直接规格两种数据输入和监控选项。扣3分:未声明非适用范围,中文支持未说明,面向中国网络的可达性未验证;核心平台和对象存储访问可能依赖环境特定服务。
具备名称、描述、Apache-2.0许可、作者、版本0.1.0、标签、兼容性和相对完整的信息分层;仓库材料还提供同步维护和更新背景。扣6分:缺少推荐的Instructions和Examples章节,缺少FAQ、变更日志、明确维护责任人/更新路径细节,skill-card的作者格式和顶层许可证元数据存在不一致。
文档提供了从平台选择、凭据收集、镜像确认、数据验证、资源预检到用户确认和监控的端到端启动流程,且基准报告显示一次外部评估任务通过。扣1分:只有单个评估任务且未静态验证真实启动结果、输出产物或跨平台覆盖;执行后结果格式和验收标准不够明确。
存在提交的evals.json、BENCHMARK.md、版本信息以及基准指标和静态验证发现,提供了有限的可审计证据。扣1分:评估仅1个任务、每个代理1次尝试,目标技能没有覆盖关键平台路径的提交测试,无法独立复现真实行为;基准结论主要是报告性证据。
- 这是仅基于源文件的静态审查,未执行任何命令、预检、平台访问、作业提交或监控,因此不要将基准报告视为本次独立复现。
- 启动流程会接触凭据、数据集、容器、远程主机和云平台;在实际使用前应确认最小权限、数据合规、镜像来源、网络可达性以及作业取消和资源回收方案。
- 面向中国用户时,应单独验证TAO依赖的镜像仓库、平台API、对象存储和远程日志服务是否可达。
这个 Skill 能做什么,适合哪些场景?
tao-launch-workflow 是 NVIDIA TAO 工作流的共享启动入口技能,适用于 AutoML、训练、评估、推理、导出、TensorRT 引擎生成以及 DEFT 或其他工作流作业。它要求在产生运行脚本、工作区、日志或提交作业前完成完整预检,并让用户确认平台、镜像、数据集、计算资源和运行预期。技能依赖打包的 TAO skill bank helper scripts,并支持 Brev、SLURM、local-docker、remote-docker 和 Kubernetes 等路径中的相关检查。SKILL.md 标注许可证为 Apache-2.0;仓库 README 将整个目录项目标为 Apache 2.0 与 CC BY 4.0 双许可证。
运行 TAO 平台列表、平台详情、容器镜像解析和启动预检 helper;询问执行平台、监控偏好、数据集输入、容器镜像、计算形状与凭证;检查平台访问、数据集路径、所需工具、Docker/GPU 或远程平台条件;在用户确认启动评审前阻止创建 runner 脚本、spec、工作区、状态文件、日志和作业提交;启动后按设定间隔持续报告作业状态,直到作业结束或用户停止监控。
- TAO 用户准备在 SLURM 集群上训练模型,需要先验证 SSH、共享数据路径、GPU 资源和镜像。
- AutoML 用户希望在提交推荐任务前确认预算、并发数、算法、指标、数据集和默认配置。
- 团队需要在 local-docker 或 remote-docker 上运行 TAO 推理、导出或 TensorRT 引擎生成,并先检查 Docker、GPU 和镜像兼容性。
- Kubernetes 或 Brev 用户准备使用对象存储数据启动 TAO 工作流,需要验证平台访问和 S3 路径可读性。
这个 Skill 有哪些优点和局限?
- 覆盖 TAO 训练、评估、推理、导出、TensorRT、AutoML 和 DEFT 等多类启动场景。
- 明确阻止预检完成前产生脚本、日志、工作区或其他副作用。
- 包含容器镜像确认、凭证过滤、数据集路径验证和启动后监控规则。
- 支持根路径模式与直接 spec 参数模式,便于处理非标准数据布局。
- 不能单独完成具体模型或工作流的模型配置;仍需要相应的 TAO 模型或应用技能。
- 依赖打包的 TAO skill bank helper scripts,源文档未提供其安装步骤。
- 需要平台访问、数据存储和凭证验证;这些检查失败时技能会停止启动流程。
- 提供的是启动门禁与流程编排,源文档没有显示独立的测试套件或平台成功率证据。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-launch-workflow --yes
也可以先安装整个 NVIDIA skills 集合:
npx skills add nvidia/skills
README 未规定该命令将技能安装到哪个具体本地目录;CLI 会处理安装目标。
如何使用这个 Skill?
在相关 TAO 操作前触发此技能,例如:"在 SLURM 上启动 TAO 训练工作流,先完成启动预检并在聊天中每 5 分钟报告状态。" 随后按技能要求提供平台、监控设置、数据集根路径或直接 spec 路径、确认后的容器镜像、计算形状和所需凭证。技能要求在所有预检项目通过且用户确认启动评审后,才创建启动产物或提交作业。