TAO Visual ChangeNet 工业视觉检测
训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。
文档明确披露了 Docker、GPU、S3、Hugging Face、NGC_API_KEY 和宿主机挂载等数据流,并限定 allowed-tools 为 Read/Bash;但使用 --gpus all、环境变量注入密钥和外部模型下载,未规定最小 GPU/网络权限、用户确认、敏感数据处理、完整隔离或回滚,因此扣分。
文档覆盖任务路由、数据格式、模型权重、错误模式和故障排查,且明确若缺少 schema 或 ONNX 应报告阻塞;但静态材料没有可执行复现、完整测试套件或明确的异常输出契约,且存在若干配置路径/动作说明不一致,因此受静态上限约束并扣分。
目标用户、AOI/PCB 场景、分类与分割输入结构及触发短语较清晰;但未说明非适用边界、中文交互支持或不同硬件/存储环境的兼容范围,且核心权重暂存依赖 Hugging Face、运行依赖 NVIDIA Docker/NGC,可能受中国大陆网络可达性影响,因此扣分。
具备名称、描述、Apache-2.0 许可、作者、版本、引用资料、参数说明和故障排查;但缺少独立 Instructions/Examples 章节,缺少 changelog、明确维护责任和更新流程,并有 benchmark 报告指出目录/文件结构规范问题,因此扣分。
对训练、评估、推理、导出、量化和分割工作流提供了较完整的配置与数据要求,理论上能直接指导任务;但没有本次评估中可核验的代表性产物,且单一 benchmark 任务和有限覆盖不足以证明真实结果正确性、完整性及相对替代方案的收益,因此按静态上限扣分。
提供固定版本、提交的 evals.json 和 benchmark 摘要,部分关键主张可追溯;但只有一个评估任务,没有原始日志、完整测试覆盖、独立复现材料或多来源交叉验证,因此只能给有限分数。
- 运行示例会暴露 NGC_API_KEY 到容器并挂载数据、结果和模型文件;使用前应确认密钥最小权限、数据边界、GPU范围和输出清理/回滚方案。
- 首次分割运行需编译 CUDA 自定义算子,且模型权重暂存依赖 Hugging Face;应预先验证网络、镜像、磁盘和缓存可用性。
- skill_info.yaml 与正文对部分 segment 数据源、动作和模板的描述存在不一致,发布前应统一并补充可复现测试。
这个 Skill 能做什么,适合哪些场景?
这是 NVIDIA TAO Toolkit 的 Visual ChangeNet 技能,面向 AOI 和 PCB 视觉检测。它支持成对图像的 PASS/NO_PASS 二分类,以及生成像素级变化分割掩码。技能覆盖训练、评估、推理、导出、量化和部分 TensorRT 部署流程,并提供数据格式、配置、故障排查和父模型推断指导。运行需要 Docker、nvidia-container-toolkit 和具备至少 16GB 显存的 NVIDIA GPU。
读取 TAO schema、模板和 skill_info 配置;根据分类或分割任务构造数据源路径与 spec 覆盖项;通过 TAO Toolkit 或本地 Docker 执行训练、评估、推理和导出等流程;分类模式读取包含 input_path、golden_path、label、object_name 的 CSV 与图像归档,分割模式读取 A、B、list、label 配对目录;在启动前将 Hugging Face 的 C-RADIO 权重下载到本地并挂载到容器;输出分类结果、变化分割掩码、检查点、导出模型或部署所需的 ONNX 工件。
- AOI 工程师为 PCB 缺陷建立 PASS/NO_PASS 成对图像分类模型。
- 机器视觉团队用 before/after 图像训练像素级变化掩码模型。
- TAO 用户需要评估、推理或导出已训练的 Visual ChangeNet 检查点。
- 部署工程师希望根据已有 ONNX 工件生成 Visual ChangeNet 的 TensorRT 引擎。
- 平台工程师需要排查预训练权重路径、数据格式、显存不足或分割 CUDA 扩展错误。
这个 Skill 有哪些优点和局限?
- 同时覆盖成对图像分类和变化分割两种 AOI 检测模式。
- 提供明确的数据目录、CSV 字段、spec 覆盖项和关键参数指导。
- 说明 C-RADIO 权重必须本地暂存并挂载,减少常见启动失败。
- 包含 AutoML 路由、父模型推断、故障排查和本地 Docker 运行说明。
- 依赖 Docker、nvidia-container-toolkit、NVIDIA GPU 和 TAO 运行环境。
- C-RADIO 权重需要在训练前从 Hugging Face 下载并占用约 393 MB。
- 分割任务首次运行需编译 MultiScaleDeformableAttention CUDA 扩展,约需 5 分钟。
- 部分 quantize、gen_trt_engine 和部署动作是否可运行取决于打包的 skill_info、schema 和 ONNX 工件;源材料未提供完整测试结果。
如何安装这个 Skill?
使用 NVIDIA 技能集合的 CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-train-visual-changenet --yes
也可以先安装整个集合:
npx skills add nvidia/skills
README 未说明单独的手工复制步骤;安装后,客户端下次加载技能并遇到相关任务时使用它。
如何使用这个 Skill?
安装后,可向智能体发送例如“train Visual ChangeNet for PCB defect detection”“ChangeNet classify”或“ChangeNet segment”。先说明任务模式、数据位置、规格文件、输出目录、GPU/平台和父检查点。分类数据需要图像目录与四列 CSV;分割数据需要包含 A/、B/、list/、label/ 的目录。训练阶段默认使用 AutoML;如需普通训练,明确要求关闭 AutoML。使用本地 Docker 时,需要解析 versions.yaml 中的 TAO 镜像,使用 --shm-size=8g,并挂载本地 C-RADIO safetensors 权重。