数据与分析 ✓ NVIDIA · 官方 instance-segmentationgrounding-dinoopen-vocabulary-segmentationmask-predictionnvidia-taotensorrtautoml

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

FollowSkills 评估 · FSRS-2.0
不推荐
51/ 100 五分制 2.6 / 5
信任安全15 / 25 · 3.0/5

技能声明仅允许 Read 和 Bash,且说明 Docker/NVIDIA Container Toolkit 要求;数据路径、S3 示例、模型检查点和 encryption_key 流程可见,也提示 TensorRT 部署需读取专门参考文档。扣分原因是未规定用户确认、最小化 Bash 范围、敏感数据处理、外部网络/Weights & Biases 数据流、回滚或恢复机制;默认模板还启用 wandb。未见红线级恶意行为或凭据窃取。

可靠稳定8 / 20 · 2.0/5

SKILL.md、skill_info.yaml 和多个 spec 模板对 train/evaluate/inference/export/quantize 及部署映射较一致,并提供 CUDA OOM、部署字段和模型形状错误提示。扣分原因是静态材料未覆盖关键路径的可执行测试,依赖版本与容器可用性未充分说明,异常输入、失败恢复和用户可诊断反馈仍有限;基准仅有一个任务,不能支持高于静态上限10分。

适用触发10 / 15 · 3.3/5

名称、描述、触发短语、支持动作、数据格式、硬件要求和 AutoML 边界较明确,适合 TAO Mask Grounding DINO 工作流。扣分原因是未明确非适用场景、输入输出契约和更多触发排除条件;没有中文交互或中国大陆网络可达性说明,且 Docker、模型权重及可能的外部服务环境适配证据不足。

规范维护8 / 15 · 2.7/5

文档包含元数据、分动作数据要求、参数、模板、部署参考、错误模式和版本号,并且仓库提供许可证、同步和更新背景。扣分原因是缺少推荐的 Instructions/Examples 部分,作者格式不完整,SKILL.md 的 Apache-2.0 与仓库文档采用 CC-BY-4.0/Apache-2.0 的整体许可说明存在治理歧义;无明确变更日志、维护责任人或技能级更新路径,基准还记录了目录层级和额外 schemas 结构告警。

有效结果6 / 15 · 2.0/5

技能覆盖训练、评估、推理、导出、量化和 TensorRT 部署,给出可直接改写的 spec_overrides、数据源字段和关键参数,因此核心任务价值明确。扣分原因是静态材料没有验证真实模型输出、端到端结果或与手工/替代方案的收益;基准只有一个计划型任务,且 Codex 正确性和有效性结果有限。

证据核验4 / 10 · 2.0/5

仓库提供固定 revision 下的 SKILL.md、生成 schema 元数据、配置模板、评估任务和一份 benchmark 报告,关键声明具有一定审计线索。扣分原因是仅一个评估任务、无覆盖关键路径的提交测试套件或真实 CI 执行证据,benchmark 结果本身也未提供可复现运行细节;因此静态证据不足以支持高分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 默认模板启用 Weights & Biases,使用前应确认是否允许向外部服务发送运行元数据或代码信息。
  • 训练和部署会产生 GPU、容器、模型权重及可能的云存储访问成本;文档未提供回滚、清理或失败恢复步骤。
  • 应先核对仓库实际目录结构、生成 schema/template 是否齐全,以及 Docker、NVIDIA Container Toolkit、TAO 容器和模型权重在目标网络环境中的可用性。
  • Apache-2.0 技能元数据与仓库对文档采用 CC-BY-4.0 的说明需要在发布或再分发前澄清。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA TAO Toolkit 中的 Mask Grounding DINO,用于文本引导的开放集实例分割。它覆盖训练、评估、推理、导出、量化及 TensorRT 部署流程。训练阶段默认支持 AutoML,并要求使用规定的数据源配置;非训练操作保留在模型技能内执行。运行环境需要 Docker 和 nvidia-container-toolkit,建议每张 GPU 具备 24GB 以上显存。

读取训练策略、模型信息、动作 schema 和 spec 模板;根据动作构造训练、验证、评估、推理及量化所需的数据源路径;执行或路由 TAO Mask Grounding DINO 的 train、evaluate、inference、export 和 quantize 操作;在启用 AutoML 且相关 schema 和模板存在时,通过 tao-run-automl 运行训练;为 TensorRT 引擎生成、TensorRT 评估和 TensorRT 推理读取部署参考;处理父任务模型、输出目录、ONNX 文件和 TensorRT 引擎等参数映射。

  1. 使用自定义 ODVG 或 COCO 数据训练文本提示驱动的实例分割模型的计算机视觉工程师。
  2. 需要用验证集评估已训练 Mask Grounding DINO 检查点的模型开发者。
  3. 希望输入诸如“person”或“bicycle”等文本提示执行开放词汇分割推理的研究人员。
  4. 需要导出 ONNX、量化模型或生成 TensorRT 引擎以进行 GPU 部署的工程师。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从训练到导出、量化和 TensorRT 部署的完整模型工作流。
  • 支持开放词汇、文本提示驱动的实例分割。
  • 提供动作 schema、spec 模板、参数映射和常见错误处理说明。
  • 支持 AutoML,并明确使用 val_loss 作为最小化指标。
局限
  • 要求 Docker、nvidia-container-toolkit 和 NVIDIA GPU;建议每张 GPU 使用 24GB 以上显存。
  • 掩码预测头比 Grounding DINO 额外占用显存,显存不足时需要减小 batch_size。
  • 数据源配置对每个动作都是强制的,使用者需要准备 ODVG、COCO 或指定归档文件。
  • 提供材料未说明该单项技能的独立测试套件或具体性能基准。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI:npx skills add nvidia/skills --skill tao-train-mask-grounding-dino --yes。CLI 会处理安装目标;无需手动克隆仓库或复制技能目录。运行环境还需要 Docker 和 nvidia-container-toolkit。

如何使用这个 Skill?

安装后,向兼容的 Agent Skills 客户端提出“train Mask Grounding DINO”或“运行文本提示驱动的实例分割推理”等请求。训练、评估、推理和量化时必须提供对应的数据源路径;训练可通过 automl_policy: onoff 控制本次运行是否使用 AutoML。TensorRT 相关操作还需使用该技能 references/tao-deploy-mask-grounding-dino.md 中的部署流程。

这个 Skill 与同类方案有什么区别?

该技能明确以 Grounding DINO 为基础并复用其部分训练设置;Mask Grounding DINO 增加了掩码预测头,因此适合实例分割,而不是仅使用 Grounding DINO 的检测工作流。

常见问题

它只支持训练吗?
不支持。它还覆盖 evaluate、inference、export、quantize,以及通过 TAO Deploy 进行 TensorRT 引擎生成、评估和推理。
需要多少 GPU 显存?
最低需要 1 张 GPU,建议使用 4 张;每张 GPU 建议具备 24GB 以上显存,A100 是推荐配置。
AutoML 是否可以关闭?
可以。新建训练请求只暴露 `on` 和 `off`;“disable AutoML”“no HPO”或“plain training”等表达应按本次运行关闭 AutoML。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

TAO Mask2Former 分割技能

指导使用 NVIDIA TAO 训练和部署 Mask2Former 分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAE 视觉预训练技能

指导 NVIDIA TAO 使用掩码自编码器进行视觉预训练与微调。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO DAFT 数据集验证器

用 tao-daft validate 检查 TAO DAFT 数据集的结构、架构与交叉引用错误。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

相关 Skills