数据与分析 ✓ NVIDIA · 官方 self-supervised-learningvision-transformernvdinov2visual-representation-learningtao-toolkittensorrt

TAO NVDINOv2 视觉表征训练

用无标签自蒸馏训练可复用的视觉特征骨干。

FollowSkills 评估 · FSRS-2.0
不推荐
47/ 100 五分制 2.4 / 5
信任安全14 / 25 · 2.8/5

技能声明仅允许 Read 和 Bash,并明确要求 Docker/NVIDIA Container Toolkit;未见恶意行为、凭据窃取或隐蔽外传。但训练、导出和推理会访问数据集、检查点、结果目录及加密键,缺少用户确认、数据流披露、敏感数据处理、回滚和依赖完整性说明,因此扣分。

可靠稳定7 / 20 · 1.8/5

文档覆盖 AutoML 路由、数据源、检查点选择和多种错误模式,主路径基本连贯。静态证据显示推理模板使用 inference.checkpoint,而 skill_info.yaml 使用 inference.checkpoint、模板实际字段又为 inference.checkpoint,仍有配置一致性风险;缺少可复现的关键路径测试和更完整的异常反馈,且静态评估上限限制为10,因此扣分。

适用触发9 / 15 · 3.0/5

触发短语、训练/导出/推理场景、数据格式、硬件要求和非可用 distill 动作均有说明。范围主要面向具备 A100 40GB+、Docker 和 TAO 环境的用户;未声明中文支持、非适用边界和网络可达性,适用面受限,因此扣分。

规范维护8 / 15 · 2.7/5

具有名称、描述、Apache-2.0 许可、版本、作者、参数表、模板、错误模式和维护/同步背景。缺少推荐的 Instructions 与 Examples 章节,作者格式不完整,缺少变更日志、明确维护负责人/更新路径和更系统的 FAQ;仓库报告也记录了目录结构和 schemas 规范问题,因此扣分。

有效结果6 / 15 · 2.0/5

文档可指导构造训练、导出和推理配置,并说明检查点交接、AutoML 指标和常见失败处理,核心任务价值明确。没有在本次静态审查中执行,也没有足够代表性输出证明结果可直接使用;配置字段不一致可能造成返工,因此按静态上限保守扣分。

证据核验3 / 10 · 1.5/5

存在版本化模板、skill_info.yaml、评估任务和 benchmark 报告,提供了有限的审计线索。评估仅含1个正向任务、无负向任务,报告没有提交可核验的运行日志或覆盖关键训练路径的测试套件;静态审查下最高5分,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前确认 Docker、NVIDIA Container Toolkit、TAO 容器、A100 40GB+ GPU 和数据源均可用。
  • 核对 skill_info.yaml 与推理模板中的检查点字段,并确认使用 student_epoch_*.pth 而非训练总检查点。
  • 处理数据集、检查点和 encryption_key 时应先获得用户确认并避免将敏感内容写入日志或外部服务。
  • 评估报告仅覆盖一个正向计划任务,不能证明实际训练、导出或推理成功。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导使用 NVIDIA TAO Toolkit 训练、导出和推理 NVDINOv2 视觉变换器。它通过教师—学生自蒸馏进行无监督预训练,不需要标签,并生成通用视觉特征。训练支持 AutoML,可根据每次运行的策略选择 AutoML 或直接训练。该技能面向 Docker 和 NVIDIA GPU 环境,默认的 ViT-Large 配置对显存要求很高。

读取技能内的 TAO Core JSON schema、YAML spec template、AutoML 配置和部署参考;构造训练与推理所需的数据源路径;通过 TAO 运行训练、AutoML、导出和推理流程;在导出和推理时传递选定的 student_epoch_*.pth 检查点;生成 ONNX 文件,并为 TAO Deploy TensorRT 流程提供部署指引。

  1. 计算机视觉研究人员在没有标注数据时进行 ViT 自监督预训练。
  2. 模型工程师使用训练得到的通用视觉特征开展下游任务。
  3. TAO 用户通过 AutoML 选择训练配置和最佳模型。
  4. 部署工程师将选定的 NVDINOv2 检查点导出为 ONNX 或生成 TensorRT 引擎。
  5. 平台工程师在多 GPU 或多节点环境中运行 Lightning 管理的训练。

这个 Skill 有哪些优点和局限?

优点
  • 支持无标签的教师—学生自蒸馏训练。
  • 覆盖训练、AutoML、导出、推理和 TAO Deploy 相关流程。
  • 包含 schema、模板、检查点传递和常见错误处理指引。
  • 支持 Lightning 管理的多 GPU 和多节点训练。
局限
  • 默认 ViT-Large 教师与学生模型非常耗显存,要求至少 40GB 级别 GPU,且技能建议使用 4–8 张 GPU。
  • 需要 Docker 和 NVIDIA Container Toolkit。
  • SSL 训练不使用标签,评估依赖下游任务。
  • 源码只声明版本 0.1.0;提示中的默认 10 个 epoch 更适合快速测试,生产训练通常需要 100 个以上 epoch。
  • PyT inference 不接受 TensorRT engine,且没有独立的 distill action。

如何安装这个 Skill?

使用仓库 README 中的 Skills CLI 安装:

npx skills add nvidia/skills --skill tao-train-nvdinov2 --yes

运行环境还需要 Docker、NVIDIA Container Toolkit,以及满足显存要求的 NVIDIA GPU。README 未说明更细的 TAO 容器或版本安装步骤。

如何使用这个 Skill?

安装后,可向 Agent 提出“train NVDINOv2”“self-supervised ViT pretraining”“DINOv2 backbone”或“visual representation learning”等请求。训练前读取 references/skill_info.yaml,并按请求解析 automl_policy;训练和推理必须提供对应的 images_train.tar.gz 或 images_test.tar.gz 数据源路径。导出和推理应使用选定的 student_epoch_*.pth 检查点;执行 gen_trt_engine 前先读取 references/tao-deploy-nvdinov2.md。

常见问题

必须使用 A100 GPU 吗?
技能明确要求至少 4 张 GPU,并推荐每张具备 40GB 以上显存的 A100;较小 ViT、较低图像尺寸或更小 batch size 可用于缓解显存不足,但源文未承诺其他硬件配置。
训练一定会运行 AutoML 吗?
该模型在模型层面启用 AutoML,默认使用 automl_policy: on;明确要求关闭 AutoML、禁用 HPO 或进行普通训练时,本次运行可使用 off。
导出或推理应使用哪个检查点?
使用选定 AutoML 或训练运行中的 student_epoch_*.pth。model_epoch_*.pth 仅用于恢复或重新训练,nvdinov2_model_latest.pth 可能包含 Lightning、优化器和调度器状态。
能否直接用 TensorRT engine 做 PyT 推理?
不能。打包的 PyT inference 只加载 .pth 或 .tlt;TensorRT engine 由 TAO Deploy 的 gen_trt_engine 流程生成,供下游消费者使用。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO 度量学习识别

为细粒度视觉识别训练可用于检索匹配的图像嵌入模型。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

开发与工程 ✓ NVIDIA · 官方

TAO OCRNet 场景文字识别技能

用 NVIDIA TAO 训练并部署场景文字识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAE 视觉预训练技能

指导 NVIDIA TAO 使用掩码自编码器进行视觉预训练与微调。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

数据与分析 ✓ NVIDIA · 官方

TAO 图像指代表达定位

将图像和文字描述转换为带像素级边界框的短语定位标注。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO CLIP 微调与部署

为图文检索、零样本分类和嵌入提取训练并部署 NVIDIA TAO CLIP 模型。

相关 Skills