TAO AutoML + DEFT 三阶段训练管线
为 AOI 与其他 DEFT 应用串联超参数优化、数据改进和最终模型精调。
文档要求在 docker pull、登录、作业启动和结果目录写入前取得一次明确确认,并要求不打印凭据值、检查数据泄漏、保留 KPI 测试集;这些支持中等信任分。扣分原因是允许 Bash/Write、docker login/pull 和跨阶段自动执行,未定义最小权限、依赖漏洞控制、备份或回滚;还会直接覆盖 baseline_spec.yaml。
三阶段流程、交接产物、停止条件、预检和硬停止情形描述较完整,异常时可跳过 Phase 3。扣分原因是实际执行依赖未提供的下游技能、脚本和环境,静态材料没有覆盖关键路径的测试或 CI;旧版下游 gate 还可能导致额外交互,且若 handoff 状态格式不匹配,失败诊断仍不充分。静态校准下不超过 10。
触发短语、适用场景、AOI 与非 AOI 分流及不适用范围均有明确说明。扣分原因是非 AOI 路由仅描述为通用模式,缺少具体接口边界;没有中文交互支持或中国大陆网络可达性证据,核心依赖 Docker、NVIDIA 容器、NGC/HF 凭据和下游技能。
前置元数据包含名称、Apache-2.0、作者、版本和依赖;正文采用预检、阶段、交接、陷阱和快速开始分层,并提供引用文档、评估报告和更新说明。扣分原因是评估发现缺少 Instructions 和 Examples 推荐章节,作者格式不规范,版本变更记录、维护责任和正式更新路径仍不完整;skill-card 与实际 frontmatter 的许可表述也不完全一致。
目标输出是最终 AutoML checkpoint,并明确三阶段输入、交接、指标选择、warm-start 和回归保护,理论上能完成端到端训练任务;评估报告也记录了单任务的正确性和效果结果。扣分原因是没有在本材料中提供可直接复核的实际训练产物或完整结果,运行成本高且依赖多个外部技能,最终效果仍需人工检查。静态校准下不超过 7。
源文件提供了较详细的命令模式、状态字段、路径约定、指标和评估报告,具备一定审计性。扣分原因是评估仅覆盖 1 个任务、无负向触发样例、无提交的关键路径测试或可独立复现日志;报告中的结果不足以支持多源交叉验证。静态校准下不超过 5。
- 执行前必须核实所有下游技能、脚本、容器镜像、GPU、数据集和凭据要求;本评估未执行这些检查。
- 确认后流程原则上不再暂停,且会进行文件写入和容器登录/拉取;应先建立结果目录备份并明确回滚方案。
- 不要仅凭 val_loss 选择 AOI 模型;必须检查类别预测计数,并使用 FAR @ 100% recall 或等价 KPI 复核。
- 需要验证 NGC/Hugging Face 服务在目标网络中的可达性,以及数据和凭据的合规处理方式。
这个 Skill 能做什么,适合哪些场景?
该技能将 AutoML 基线、DEFT 迭代数据改进和 DEFT 后 AutoML 精调串联为三个阶段。它默认面向 NVIDIA TAO Toolkit 的 PCB AOI ChangeNet 工作流,也可路由到其他 DEFT 应用。技能负责阶段之间的规格文件、检查点和增强训练数据交接,不重新实现 AutoML 或 DEFT。运行需要 Docker 和 nvidia-container-toolkit,并且整个流程在唯一一次用户批准后连续执行。
读取训练集、验证集、工作区规格和下游技能的预检要求;调用 tao-run-automl 执行基线超参数搜索;选择最佳超参数和检查点,合并规格并预填 DEFT 状态,使 DEFT 跳过重复的基线训练;调用 tao-run-deft-aoi 或其他匹配的 DEFT 技能执行 RCA、路由、SDG、挖掘、数据组装和普通训练迭代;从 deft_state.json 获取最佳检查点及最终迭代编号;使用增强后的训练 CSV 和 DEFT 检查点重新运行 AutoML;将最终检查点登记到 deft_state.json,并生成或更新推理交接所需的信息。
- 需要端到端改进 PCB AOI ChangeNet 模型的团队,可运行 AutoML + DEFT 全流程。
- 希望先调优超参数、再执行 DEFT 数据改进的视觉训练用户,可使用该技能完成预热交接。
- 需要在 DEFT 增强数据集上再次搜索超参数的用户,可让第三阶段以 DEFT 最佳检查点为起点。
- 使用非 AOI DEFT 应用、但需要相同“AutoML → DEFT → AutoML”模式的用户,可路由到对应的 DEFT 技能。
这个 Skill 有哪些优点和局限?
- 明确串联基线 AutoML、DEFT 数据改进和后处理 AutoML。
- 复用第一阶段检查点,避免 DEFT 重复执行基线训练。
- 第三阶段从 DEFT 最佳检查点暖启动,并保留验证集以便比较。
- 内置一次性预检、数据泄漏检查、类别不平衡和运行噪声提示。
- 流程按顺序执行,第一和第三阶段各包含多次训练,DEFT 迭代通常成本最高。
- 依赖 Docker、nvidia-container-toolkit 以及 tao-run-automl 和 DEFT 下游技能。
- DEFT 不可恢复地硬停止时会跳过第三阶段。
- SKILL.md 未列出下游工作流的全部额外依赖,也未提供该单项技能的独立运行时间或平台测试矩阵。
如何安装这个 Skill?
使用 NVIDIA/skills 集合中的 skills CLI 安装:npx skills add nvidia/skills --skill tao-run-automl-deft-pipeline --yes。也可按 README 的说明指定目标客户端,例如追加 --agent codex。安装后,相关 Agent 在加载技能并遇到匹配任务时使用它。
如何使用这个 Skill?
向 Agent 提出“run the AOI workflow”、“AOI end-to-end”、“AutoML + DEFT”或“improve my AOI ChangeNet model”等请求。开始前,Agent 会汇总主机、凭据、镜像、数据集、三阶段配置和计算估算,并要求一次批准;批准后依次运行三个阶段。需要提供或确认工作区、数据集路径、配置以及每个训练作业的大致耗时;具体下游技能参数由 tao-run-automl 和目标 DEFT 技能决定。
这个 Skill 与同类方案有什么区别?
相较于仅运行 tao-run-deft-aoi,该技能增加了前置和后置 AutoML;相较于仅运行 tao-run-automl,它还执行 DEFT 数据改进循环。用户明确要求仅 DEFT 或仅 AutoML 时,应分别使用对应下游技能。