TAO DEFT AOI 检测优化循环
为 PCB 视觉检测模型自动执行评估、缺陷增强、挖掘、重训与部署门控。
文档明确设置一次性预检确认、路径范围、硬停止条件、泄漏检查和原子报告写入,并说明HF_TOKEN/NGC_KEY用途;但允许Bash、Write、Docker及全自动训练、数据生成和部署门控,要求启用自动模式绕过权限提示,且外部模型下载、凭证暴露边界、部署回滚和结果恢复方案不完整,因此扣分。
流程、状态文件、日志seq不变量、磁盘为事实源、阻塞恢复和硬停止规则描述较细;但未提供可在本次静态材料中独立复现关键路径的测试套件,跨技能依赖和运行时辅助函数存在,异常覆盖仍有限;按静态上限保守扣分。
触发条件、适用模型、非适用场景、输入数据契约和max_iterations要求清楚;但高度依赖NVIDIA TAO、Docker、GPU、HuggingFace及相关技能,未说明中文交互或中国大陆网络可达性,且无工作区时仍需额外引导,因此扣分。
SKILL.md采用分层引用,提供许可证、作者、版本、脚本用法、数据布局、报告协议和限制说明;但维护责任、变更日志、更新路径和完整示例/FAQ不足,BENCHMARK还记录缺少推荐Instructions/Examples及目录结构告警,因此扣分。
目标是自动完成AOI模型的基线、RCA、合成缺陷、挖掘、重训和KPI门控,输出包括状态、日志、HTML报告和推理规格;BENCHMARK报告了一次外部评估且总体通过,但仅一个任务、无独立关键结果复现,实际输出仍依赖大量用户数据和外部组件,静态评估不超过7分。
材料包含固定修订信息、详细输入输出契约、评估报告和部分可审计规则;但没有多次独立复现、完整测试覆盖或多源交叉证据,BENCHMARK样本仅一个任务,因此只能给有限分数。
- 运行会访问外部HuggingFace/NGC资源并使用敏感凭证;应在真实执行前确认凭证范围、网络合规性和缓存位置。
- 自动模式下预检后的训练、写入结果目录和部署门控将连续执行;应确认结果目录、数据备份和可接受的外部副作用。
- 未提供中文支持或中国大陆网络可达性的证据,且依赖Docker、NVIDIA容器工具链、GPU和多个未随本次材料完整给出的技能/引用。
- BENCHMARK仅含一个评估任务,不能证明不同数据集、硬件或异常输入下的效果。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO VisualChangeNet/ChangeNet PCB 检测模型,执行完整的 DEFT AOI 改进循环。流程包括基线评估、根因分析、Cosmos AnomalyGen/AMP 合成缺陷、k-NN 数据挖掘、重训练和部署门控。它持续迭代,直到达到指定的 FAR 或召回率 KPI,或触发最大迭代次数或硬停止条件。运行需要 Docker、nvidia-container-toolkit,以及工作流所需的模型、数据和凭据。
读取工作区中的规格文件、CSV、数据集、检查点和状态文件;执行预检、基线训练或已有检查点恢复、推理、评估和 RCA;调用合成缺陷生成、样本路由、AOI 图像挖掘及 VisualChangeNet 训练相关技能;在每次迭代中更新 deft_state.json 和 loop_log.jsonl;在迭代完成及流程结束时生成 DEFT_Loop_Report.html,并在存在有效检查点时准备推理规格。它在进入任何有副作用的步骤前展示一次 Pre-Flight Summary,获得明确批准后自动继续。
- AOI 工程师希望将 ChangeNet 模型的误接受率降至目标值,同时保持指定召回率。
- PCB 检测团队需要通过 RCA 定位模型缺陷,并用合成缺陷扩充训练数据。
- 机器学习工程师希望从基线评估开始,自动执行多轮挖掘、重训和 KPI 检查。
- 部署团队需要在模型达到 FAR/召回率门槛后再生成推理部署准备材料。
这个 Skill 有哪些优点和局限?
- 覆盖从基线评估到部署门控的完整闭环,而不是单次训练。
- 明确支持 RCA、合成缺陷、k-NN 挖掘和迭代重训练。
- 具有单一预检批准门和多项硬停止条件,便于控制副作用与数据风险。
- 维护状态日志和 HTML 报告,方便跟踪每轮结果。
- 只适用于 NVIDIA TAO VisualChangeNet/ChangeNet PCB 检测改进,不适用于单次训练、一次性推理、通用异常生成或单独 RCA。
- 依赖 Docker、nvidia-container-toolkit、GPU 工作流、数据、模型检查点及相关凭据。
- HF_TOKEN 是模型权重所需凭据,NGC_KEY 用于容器拉取;来源未说明费用或配额。
- 来源未提供该技能独立测试套件或具体平台验证结果。
- 缺失工作区、规格、CSV、凭据、空挖掘池、数据泄漏或其他硬停止条件时,流程会停止且不会自动重试。
如何安装这个 Skill?
使用仓库 README 中的 skills CLI 安装指定技能:npx skills add nvidia/skills --skill tao-run-deft-aoi --yes。也可以指定客户端,例如:npx skills add nvidia/skills --skill tao-run-deft-aoi --agent codex。安装后,技能会在代理下次加载相关技能时可用。
如何使用这个 Skill?
向代理输入“运行 DEFT loop”或“将 AOI ChangeNet 模型优化到 FAR 低于 0.1%,召回率为 100%”。必须提供 max_iterations;如果只提供时间限制,技能会先换算估计迭代次数并纳入预检摘要。代理展示 Pre-Flight Summary 后等待明确批准;批准后不再逐步询问确认,直到达到 KPI、达到最大迭代次数或发生不可恢复的硬停止。