TAO NVDINOv2 视觉表征训练
用无标签自蒸馏训练可复用的视觉特征骨干。
技能声明仅允许 Read 和 Bash,并明确要求 Docker/NVIDIA Container Toolkit;未见恶意行为、凭据窃取或隐蔽外传。但训练、导出和推理会访问数据集、检查点、结果目录及加密键,缺少用户确认、数据流披露、敏感数据处理、回滚和依赖完整性说明,因此扣分。
文档覆盖 AutoML 路由、数据源、检查点选择和多种错误模式,主路径基本连贯。静态证据显示推理模板使用 inference.checkpoint,而 skill_info.yaml 使用 inference.checkpoint、模板实际字段又为 inference.checkpoint,仍有配置一致性风险;缺少可复现的关键路径测试和更完整的异常反馈,且静态评估上限限制为10,因此扣分。
触发短语、训练/导出/推理场景、数据格式、硬件要求和非可用 distill 动作均有说明。范围主要面向具备 A100 40GB+、Docker 和 TAO 环境的用户;未声明中文支持、非适用边界和网络可达性,适用面受限,因此扣分。
具有名称、描述、Apache-2.0 许可、版本、作者、参数表、模板、错误模式和维护/同步背景。缺少推荐的 Instructions 与 Examples 章节,作者格式不完整,缺少变更日志、明确维护负责人/更新路径和更系统的 FAQ;仓库报告也记录了目录结构和 schemas 规范问题,因此扣分。
文档可指导构造训练、导出和推理配置,并说明检查点交接、AutoML 指标和常见失败处理,核心任务价值明确。没有在本次静态审查中执行,也没有足够代表性输出证明结果可直接使用;配置字段不一致可能造成返工,因此按静态上限保守扣分。
存在版本化模板、skill_info.yaml、评估任务和 benchmark 报告,提供了有限的审计线索。评估仅含1个正向任务、无负向任务,报告没有提交可核验的运行日志或覆盖关键训练路径的测试套件;静态审查下最高5分,因此扣分。
- 执行前确认 Docker、NVIDIA Container Toolkit、TAO 容器、A100 40GB+ GPU 和数据源均可用。
- 核对 skill_info.yaml 与推理模板中的检查点字段,并确认使用 student_epoch_*.pth 而非训练总检查点。
- 处理数据集、检查点和 encryption_key 时应先获得用户确认并避免将敏感内容写入日志或外部服务。
- 评估报告仅覆盖一个正向计划任务,不能证明实际训练、导出或推理成功。
这个 Skill 能做什么,适合哪些场景?
该技能指导使用 NVIDIA TAO Toolkit 训练、导出和推理 NVDINOv2 视觉变换器。它通过教师—学生自蒸馏进行无监督预训练,不需要标签,并生成通用视觉特征。训练支持 AutoML,可根据每次运行的策略选择 AutoML 或直接训练。该技能面向 Docker 和 NVIDIA GPU 环境,默认的 ViT-Large 配置对显存要求很高。
读取技能内的 TAO Core JSON schema、YAML spec template、AutoML 配置和部署参考;构造训练与推理所需的数据源路径;通过 TAO 运行训练、AutoML、导出和推理流程;在导出和推理时传递选定的 student_epoch_*.pth 检查点;生成 ONNX 文件,并为 TAO Deploy TensorRT 流程提供部署指引。
- 计算机视觉研究人员在没有标注数据时进行 ViT 自监督预训练。
- 模型工程师使用训练得到的通用视觉特征开展下游任务。
- TAO 用户通过 AutoML 选择训练配置和最佳模型。
- 部署工程师将选定的 NVDINOv2 检查点导出为 ONNX 或生成 TensorRT 引擎。
- 平台工程师在多 GPU 或多节点环境中运行 Lightning 管理的训练。
这个 Skill 有哪些优点和局限?
- 支持无标签的教师—学生自蒸馏训练。
- 覆盖训练、AutoML、导出、推理和 TAO Deploy 相关流程。
- 包含 schema、模板、检查点传递和常见错误处理指引。
- 支持 Lightning 管理的多 GPU 和多节点训练。
- 默认 ViT-Large 教师与学生模型非常耗显存,要求至少 40GB 级别 GPU,且技能建议使用 4–8 张 GPU。
- 需要 Docker 和 NVIDIA Container Toolkit。
- SSL 训练不使用标签,评估依赖下游任务。
- 源码只声明版本 0.1.0;提示中的默认 10 个 epoch 更适合快速测试,生产训练通常需要 100 个以上 epoch。
- PyT inference 不接受 TensorRT engine,且没有独立的 distill action。
如何安装这个 Skill?
使用仓库 README 中的 Skills CLI 安装:
npx skills add nvidia/skills --skill tao-train-nvdinov2 --yes
运行环境还需要 Docker、NVIDIA Container Toolkit,以及满足显存要求的 NVIDIA GPU。README 未说明更细的 TAO 容器或版本安装步骤。
如何使用这个 Skill?
安装后,可向 Agent 提出“train NVDINOv2”“self-supervised ViT pretraining”“DINOv2 backbone”或“visual representation learning”等请求。训练前读取 references/skill_info.yaml,并按请求解析 automl_policy;训练和推理必须提供对应的 images_train.tar.gz 或 images_test.tar.gz 数据源路径。导出和推理应使用选定的 student_epoch_*.pth 检查点;执行 gen_trt_engine 前先读取 references/tao-deploy-nvdinov2.md。