TAO Grounding DINO 开放词汇检测
用文本提示训练和部署无需固定类别词表的目标检测模型。
技能声明仅允许 Read 和 Bash,并明确 Docker/NVIDIA 容器、数据源和加密键字段;未见恶意行为或凭据窃取。但 Bash 权限较宽,缺少用户确认、最小化路径限制、敏感数据处理说明、外部网络披露、回滚方案和结果恢复机制,因此扣分。
文档提供了动作映射、模板、数据格式、确定性训练设置及多项错误模式,且说明了归档解压、文本长度和查询数限制。可是静态材料未覆盖关键路径测试,基准只有单任务且 Codex 正确率为50%,若依赖缺失或模板不一致时的诊断仍不完整,因此限制在静态上限10以下。
名称、触发短语、训练/评估/导出/量化/推理场景、输入数据格式和硬件要求较清楚。非适用边界、语义触发排除条件和中文使用说明不足;BERT 权重可能需要下载,核心环境对网络和NVIDIA GPU依赖较强,面向中国大陆的可达性未说明,因此扣分。
SKILL.md 有前置元数据、分层章节、动作模板、参数、硬件和错误模式;版本、作者和许可证字段也存在,仓库还提供治理与发布流程。基准指出缺少 Instructions 和 Examples,且没有变更日志、明确维护负责人/更新路径、FAQ、依赖版本锁定;许可证元数据在题设中为 NOASSERTION,因此扣分。
文档覆盖 Grounding DINO 的训练、评估、推理、导出、量化和 TensorRT 部署,并给出可直接改写的 spec_overrides 与关键故障处理,核心任务价值明确。可是仅有一个正向评测任务,结果显示 Codex 正确率50%、效果76%,没有代表性输出或多场景验证;按静态校准不超过7分。
存在固定修订内容、模板、skill_info.yaml、evals.json 和一份 NVSkills-Eval 报告,提供有限审计线索。评测仅一个任务、无负向任务,缺少提交的关键路径测试和多来源交叉验证,且本次未执行任何内容,因此只能给有限分数。
- 执行前应确认 Docker、NVIDIA Container Toolkit、GPU、TAO 镜像和 BERT 权重的来源及网络可达性,尤其是中国大陆环境。
- Bash、数据路径、加密键和外部存储的使用边界未定义;应由用户确认路径、凭据和输出目录,并保留检查点以便恢复。
- 量化、TensorRT 部署和 AutoML 路由存在版本/镜像限制;应先核对打包 schema、模板、TAO 版本和模型结构参数。
- 评测证据很薄,仅覆盖一个任务,不能据此保证真实训练或部署结果。
这个 Skill 能做什么,适合哪些场景?
该技能指导 NVIDIA TAO Toolkit 中 Grounding DINO 模型的训练、评估、推理、导出、量化和 TensorRT 部署。模型结合 DINO 风格检测器与 BERT 文本编码器,可根据文本提示检测对象。训练支持 ODVG、COCO 和 raw 数据格式,并默认采用 AutoML 路由。运行需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU。
读取模型的 TAO schemas、规格模板和部署参考文件;根据动作构造训练、验证、推理、评估和量化所需的数据源覆盖项;运行 Grounding DINO 的 train、evaluate、inference、export 和 quantize 流程;通过部署参考流程生成 TensorRT 引擎并执行 TensorRT 评估或推理;处理检查点、ONNX 文件和部署输出路径推断。训练可按每次运行选择启用或关闭 AutoML。
- 需要用自有 ODVG 或 COCO 数据训练开放词汇目标检测器的视觉开发者。
- 需要通过文本提示检测未固定在训练类别词表中的对象的研究人员。
- 需要评估已训练 Grounding DINO 检查点并使用 val_mAP50 监控结果的工程团队。
- 需要导出 ONNX、量化模型或生成 FP16/FP32 TensorRT 引擎的部署工程师。
- 需要在多 GPU 或多节点环境中使用 Lightning、DDP 或 FSDP 训练模型的团队。
这个 Skill 有哪些优点和局限?
- 支持文本提示驱动的开放词汇检测,而非固定类别词表。
- 覆盖训练、评估、推理、导出、量化和 TensorRT 部署流程。
- 提供数据源要求、规格覆盖示例、检查点推断规则和常见故障处理。
- 支持 AutoML、单 GPU、多 GPU 及多节点训练配置。
- 依赖 Docker、nvidia-container-toolkit 和 NVIDIA GPU,不能作为纯 CPU 技能使用。
- 模型包含 BERT 文本编码器,显存需求高;24GB 以上显存被建议用于每张 GPU。
- TensorRT 仅支持 FP32 和 FP16,不支持 INT8。
- 源材料未提供独立测试结果、完整安装矩阵或具体 TAO CLI 命令。
- 量化可能受到特定 TAO Toolkit 7.0.0-rc-226 镜像缺陷影响。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-train-grounding-dino --yes
安装后,技能会在智能体下次加载技能并遇到相关任务时可用。源材料未说明手动安装后的具体目录结构或独立运行包的安装命令。
如何使用这个 Skill?
向智能体提出明确任务,例如“train Grounding DINO”或“run open-vocabulary detection”,并提供训练、评估或推理所需的数据位置、模型检查点和输出目录。训练时默认使用 AutoML;如需关闭,可说明“disable AutoML”或“plain training”。必须为每个动作提供对应的数据源覆盖项。TensorRT 引擎生成、TensorRT 评估和 TensorRT 推理前,智能体应读取 references/tao-deploy-grounding-dino.md。具体 TAO CLI 启动命令未在源材料中完整给出。
这个 Skill 与同类方案有什么区别?
相较于固定词表目标检测器,该技能面向由文本描述目标的开放词汇检测;相较于标准 DINO,Grounding DINO 增加了 BERT 文本编码器,因此更适合语言引导检测,但资源开销更高。