数据与分析 ✓ NVIDIA · 官方 object-detectionopen-vocabulary-detectiongrounding-dinonvidia-taotensorrtautomldocker

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

FollowSkills 评估 · FSRS-2.0
不推荐
56/ 100 五分制 2.8 / 5
信任安全16 / 25 · 3.2/5

技能声明仅允许 Read 和 Bash,并明确 Docker/NVIDIA 容器、数据源和加密键字段;未见恶意行为或凭据窃取。但 Bash 权限较宽,缺少用户确认、最小化路径限制、敏感数据处理说明、外部网络披露、回滚方案和结果恢复机制,因此扣分。

可靠稳定9 / 20 · 2.3/5

文档提供了动作映射、模板、数据格式、确定性训练设置及多项错误模式,且说明了归档解压、文本长度和查询数限制。可是静态材料未覆盖关键路径测试,基准只有单任务且 Codex 正确率为50%,若依赖缺失或模板不一致时的诊断仍不完整,因此限制在静态上限10以下。

适用触发11 / 15 · 3.7/5

名称、触发短语、训练/评估/导出/量化/推理场景、输入数据格式和硬件要求较清楚。非适用边界、语义触发排除条件和中文使用说明不足;BERT 权重可能需要下载,核心环境对网络和NVIDIA GPU依赖较强,面向中国大陆的可达性未说明,因此扣分。

规范维护9 / 15 · 3.0/5

SKILL.md 有前置元数据、分层章节、动作模板、参数、硬件和错误模式;版本、作者和许可证字段也存在,仓库还提供治理与发布流程。基准指出缺少 Instructions 和 Examples,且没有变更日志、明确维护负责人/更新路径、FAQ、依赖版本锁定;许可证元数据在题设中为 NOASSERTION,因此扣分。

有效结果7 / 15 · 2.3/5

文档覆盖 Grounding DINO 的训练、评估、推理、导出、量化和 TensorRT 部署,并给出可直接改写的 spec_overrides 与关键故障处理,核心任务价值明确。可是仅有一个正向评测任务,结果显示 Codex 正确率50%、效果76%,没有代表性输出或多场景验证;按静态校准不超过7分。

证据核验4 / 10 · 2.0/5

存在固定修订内容、模板、skill_info.yaml、evals.json 和一份 NVSkills-Eval 报告,提供有限审计线索。评测仅一个任务、无负向任务,缺少提交的关键路径测试和多来源交叉验证,且本次未执行任何内容,因此只能给有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应确认 Docker、NVIDIA Container Toolkit、GPU、TAO 镜像和 BERT 权重的来源及网络可达性,尤其是中国大陆环境。
  • Bash、数据路径、加密键和外部存储的使用边界未定义;应由用户确认路径、凭据和输出目录,并保留检查点以便恢复。
  • 量化、TensorRT 部署和 AutoML 路由存在版本/镜像限制;应先核对打包 schema、模板、TAO 版本和模型结构参数。
  • 评测证据很薄,仅覆盖一个任务,不能据此保证真实训练或部署结果。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导 NVIDIA TAO Toolkit 中 Grounding DINO 模型的训练、评估、推理、导出、量化和 TensorRT 部署。模型结合 DINO 风格检测器与 BERT 文本编码器,可根据文本提示检测对象。训练支持 ODVG、COCO 和 raw 数据格式,并默认采用 AutoML 路由。运行需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU。

读取模型的 TAO schemas、规格模板和部署参考文件;根据动作构造训练、验证、推理、评估和量化所需的数据源覆盖项;运行 Grounding DINO 的 train、evaluate、inference、export 和 quantize 流程;通过部署参考流程生成 TensorRT 引擎并执行 TensorRT 评估或推理;处理检查点、ONNX 文件和部署输出路径推断。训练可按每次运行选择启用或关闭 AutoML。

  1. 需要用自有 ODVG 或 COCO 数据训练开放词汇目标检测器的视觉开发者。
  2. 需要通过文本提示检测未固定在训练类别词表中的对象的研究人员。
  3. 需要评估已训练 Grounding DINO 检查点并使用 val_mAP50 监控结果的工程团队。
  4. 需要导出 ONNX、量化模型或生成 FP16/FP32 TensorRT 引擎的部署工程师。
  5. 需要在多 GPU 或多节点环境中使用 Lightning、DDP 或 FSDP 训练模型的团队。

这个 Skill 有哪些优点和局限?

优点
  • 支持文本提示驱动的开放词汇检测,而非固定类别词表。
  • 覆盖训练、评估、推理、导出、量化和 TensorRT 部署流程。
  • 提供数据源要求、规格覆盖示例、检查点推断规则和常见故障处理。
  • 支持 AutoML、单 GPU、多 GPU 及多节点训练配置。
局限
  • 依赖 Docker、nvidia-container-toolkit 和 NVIDIA GPU,不能作为纯 CPU 技能使用。
  • 模型包含 BERT 文本编码器,显存需求高;24GB 以上显存被建议用于每张 GPU。
  • TensorRT 仅支持 FP32 和 FP16,不支持 INT8。
  • 源材料未提供独立测试结果、完整安装矩阵或具体 TAO CLI 命令。
  • 量化可能受到特定 TAO Toolkit 7.0.0-rc-226 镜像缺陷影响。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-train-grounding-dino --yes

安装后,技能会在智能体下次加载技能并遇到相关任务时可用。源材料未说明手动安装后的具体目录结构或独立运行包的安装命令。

如何使用这个 Skill?

向智能体提出明确任务,例如“train Grounding DINO”或“run open-vocabulary detection”,并提供训练、评估或推理所需的数据位置、模型检查点和输出目录。训练时默认使用 AutoML;如需关闭,可说明“disable AutoML”或“plain training”。必须为每个动作提供对应的数据源覆盖项。TensorRT 引擎生成、TensorRT 评估和 TensorRT 推理前,智能体应读取 references/tao-deploy-grounding-dino.md。具体 TAO CLI 启动命令未在源材料中完整给出。

这个 Skill 与同类方案有什么区别?

相较于固定词表目标检测器,该技能面向由文本描述目标的开放词汇检测;相较于标准 DINO,Grounding DINO 增加了 BERT 文本编码器,因此更适合语言引导检测,但资源开销更高。

常见问题

它能在没有 NVIDIA GPU 的机器上运行吗?
不适合。技能明确要求 Docker、nvidia-container-toolkit 和 NVIDIA GPU;最低要求为 1 张 GPU。
训练时必须启用 AutoML 吗?
默认启用,但可按本次运行关闭。只有在 AutoML 关闭,或训练 schema/template 缺失时,才使用直接模型训练。
为什么直接把 images.tar.gz 填入 image_dir 会失败?
直接 TAO CLI 需要解压后的图像目录。归档源应先解压,再将 image_dir 指向图像文件夹。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

开发与工程 ✓ NVIDIA · 官方

NVIDIA DeepStream 开发技能

为 Python pyservicemaker 驱动的 DeepStream 视频分析流水线提供可靠开发指导。

开发与工程 ✓ NVIDIA · 官方

DeepStream 视觉模型导入助手

将目标检测模型自动接入 NVIDIA DeepStream 并生成基准报告。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO Mask2Former 分割技能

指导使用 NVIDIA TAO 训练和部署 Mask2Former 分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

相关 Skills