数据与分析 ✓ NVIDIA · 官方 object-detectiondinotao-toolkittransformer-detectorautomltensorflow-tensorrt

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

FollowSkills 评估 · FSRS-2.0
不推荐
58/ 100 五分制 2.9 / 5
信任安全17 / 25 · 3.4/5

技能限定为 Read 和 Bash,并明确要求 Docker、NVIDIA Container Toolkit、数据集 URI、检查点和结果目录;同时说明数据源、父模型推断和常见失败。扣分原因是允许 Bash 与 Docker/S3/训练、导出和部署外部效果,但没有明确的用户确认、权限隔离、敏感数据处理、回滚或恢复流程。

可靠稳定9 / 20 · 2.3/5

SKILL.md 与引用文件对训练、评估、导出、推理、量化、蒸馏、AutoML、数据源和错误模式有较一致的说明,并指出缺少验证集、类别数不足、OOM、检查点路径等可诊断失败。扣分原因是未在选定材料中提供完整可执行复现、自动化测试或覆盖异常输入的真实测试套件;静态评估不超过10分。

适用触发11 / 15 · 3.7/5

名称、触发短语、适用动作、COCO 数据格式、必需输入、非生产 smoke profile、TensorRT 部署分流和 AutoML 开关均较明确。扣分原因是没有明确不适用场景、中文交互支持或中国大陆网络可达性说明,且核心流程依赖 Docker、NVIDIA GPU、S3/TAO SDK 等环境。

规范维护10 / 15 · 3.3/5

文档有清晰的引用地图、渐进式参考文件、参数说明、数据契约、错误目录、版本0.1.0、Apache-2.0许可和NVIDIA作者信息;基准报告还记录了结构化校验发现。扣分原因是缺少独立的 Instructions/Examples 章节,作者格式不完整,未提供明确 changelog、维护责任人和更新路径,且存在已记录的目录/架构规范问题。

有效结果7 / 15 · 2.3/5

技能覆盖 DINO 的主要工作流,并提供数据源覆盖、checkpoint 推断、AutoML 指标提取、TensorRT 分流和常见修复;BENCHMARK.md 报告单个任务的正确性和有效性结果。扣分原因是样本仅1个任务,未静态证明真实训练、导出或部署输出可直接使用,且生产结果仍需环境、数据和结果校验;静态评估上限为7分。

证据核验4 / 10 · 2.0/5

存在版本固定的仓库上下文、skill_info.yaml、评估任务和BENCHMARK.md,能够追踪部分声明与预期行为。扣分原因是只有单一评估任务、无完整测试套件或CI覆盖,也缺少多来源独立复核;静态评估上限为5分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行前应明确确认 Docker、GPU、S3/TAO 作业和输出目录等外部副作用,并限制凭据和数据访问范围。
  • AutoML smoke profile 使用固定 S3 数据集,文档已声明不适用于生产基准;不要把它当作用户数据或生产性能证据。
  • 技能依赖 NVIDIA GPU、TAO SDK/容器和远程 S3 路径;在中国大陆网络或无GPU环境中可能无法完成核心流程。
  • 发布前应补充真实多任务测试、失败恢复说明、维护更新路径、Examples/Instructions 章节和作者元数据。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA TAO Toolkit 中基于 Transformer 的 DINO 二维目标检测器。它覆盖训练、评估、导出、蒸馏、量化、TensorRT 部署和推理,并包含多尺度特征、去噪训练及可选蒸馏支持。训练时必须提供训练集、验证集 URI 和类别数量;即使没有独立验证集,也必须复用训练集 URI。运行环境需要 Docker 和 NVIDIA Container Toolkit。

读取 DINO 的数据集约束、动作参数、错误模式、AutoML 和部署参考文件;根据用户输入构造各动作所需的数据源和 spec 覆盖;处理 COCO 或 coco_raw 数据;指导使用预训练骨干或完整模型检查点;执行或编排训练、评估、导出、蒸馏、量化、TensorRT 引擎生成和推理;使用 mAP50 进行快速监控,并以 val_mAP 支持 COCO/论文式比较。

  1. 需要用 COCO 格式数据训练 TAO DINO 二维目标检测器的视觉开发者。
  2. 需要评估或推理已训练 DINO 检查点的工程师。
  3. 需要将 DINO 导出为 ONNX 或生成 TensorRT 引擎进行部署的团队。
  4. 希望启用 AutoML/HPO 做训练参数搜索,同时遵守数据集和多 GPU 配置要求的用户。
  5. 需要使用教师模型蒸馏、量化或处理 DINO 常见 CUDA 和数据配置错误的 TAO 用户。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 DINO 从训练到部署和推理的完整 TAO 工作流。
  • 明确规定验证数据始终必需,并提供类别数量、数据源和多 GPU 配置规则。
  • 包含 AutoML/HPO、检查点推断、蒸馏和常见错误处理指导。
  • 支持 COCO 与 coco_raw 数据格式,并说明标准数据归档布局。
局限
  • 必须具备 Docker 和 NVIDIA Container Toolkit。
  • 训练需要训练集 URI、验证集 URI 和正确的类别数量;验证集不能省略。
  • 数据源覆盖对每个动作都是必需的,配置错误可能导致启动失败或 CUDA device-side assert。
  • 源材料未提供该单个技能的独立测试套件或具体基准结果。

如何安装这个 Skill?

使用仓库 README 支持的 Skills CLI 安装:npx skills add nvidia/skills --skill tao-train-dino --yes。也可以先运行 npx skills add nvidia/skills --list 查看目录。源材料没有说明该单个技能的独立安装包或额外版本要求。

如何使用这个 Skill?

安装后,在加载该技能的 Agent 中提出例如“train DINO”“DETR object detection”“TAO 2D detection”或“DINO with distillation”。训练前提供训练数据 URI、验证数据 URI 和 num_classes;数据通常使用 images.tar.gz 与 annotations.json。若运行 AutoML 且未提供输入,可使用技能声明的本地 smoke profile。TensorRT 引擎生成、TensorRT 评估或 TensorRT 推理前,应先阅读 references/tao-deploy-dino.md。具体本地 Docker 命令未在源材料中给出。

常见问题

这个技能是否适合生产部署?
它覆盖导出、TensorRT 引擎生成、量化和推理流程,但源材料没有给出特定硬件上的性能或生产验证结果;应根据自己的数据和目标平台验证。
没有独立验证集怎么办?
DINO 始终构建验证数据加载器,因此必须提供 val_data_sources;没有独立评估集时可以复用训练数据 URI。
AutoML 是否默认启用?
该模型在模型层启用 AutoML。训练默认使用 automl_policy: on;用户明确要求关闭 AutoML、禁用 HPO 或使用普通训练时,该次运行可设置为 off。
需要哪些数据格式?
技能声明支持 object_detection 数据集,格式为 coco 或 coco_raw;标准 TAO DINO 数据工件为 images.tar.gz 和 annotations.json。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

开发与工程 ✓ NVIDIA · 官方

TAO 技能库能力发现

通过打包的清单快速查询 TAO Skill Bank 支持的工作流、模型、平台和 AutoML 能力。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVDINOv2 视觉表征训练

用无标签自蒸馏训练可复用的视觉特征骨干。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

相关 Skills