Mask Grounding DINO 训练与部署技能
用文本提示训练、评估并部署开放词汇实例分割模型。
技能声明仅允许 Read 和 Bash,且说明 Docker/NVIDIA Container Toolkit 要求;数据路径、S3 示例、模型检查点和 encryption_key 流程可见,也提示 TensorRT 部署需读取专门参考文档。扣分原因是未规定用户确认、最小化 Bash 范围、敏感数据处理、外部网络/Weights & Biases 数据流、回滚或恢复机制;默认模板还启用 wandb。未见红线级恶意行为或凭据窃取。
SKILL.md、skill_info.yaml 和多个 spec 模板对 train/evaluate/inference/export/quantize 及部署映射较一致,并提供 CUDA OOM、部署字段和模型形状错误提示。扣分原因是静态材料未覆盖关键路径的可执行测试,依赖版本与容器可用性未充分说明,异常输入、失败恢复和用户可诊断反馈仍有限;基准仅有一个任务,不能支持高于静态上限10分。
名称、描述、触发短语、支持动作、数据格式、硬件要求和 AutoML 边界较明确,适合 TAO Mask Grounding DINO 工作流。扣分原因是未明确非适用场景、输入输出契约和更多触发排除条件;没有中文交互或中国大陆网络可达性说明,且 Docker、模型权重及可能的外部服务环境适配证据不足。
文档包含元数据、分动作数据要求、参数、模板、部署参考、错误模式和版本号,并且仓库提供许可证、同步和更新背景。扣分原因是缺少推荐的 Instructions/Examples 部分,作者格式不完整,SKILL.md 的 Apache-2.0 与仓库文档采用 CC-BY-4.0/Apache-2.0 的整体许可说明存在治理歧义;无明确变更日志、维护责任人或技能级更新路径,基准还记录了目录层级和额外 schemas 结构告警。
技能覆盖训练、评估、推理、导出、量化和 TensorRT 部署,给出可直接改写的 spec_overrides、数据源字段和关键参数,因此核心任务价值明确。扣分原因是静态材料没有验证真实模型输出、端到端结果或与手工/替代方案的收益;基准只有一个计划型任务,且 Codex 正确性和有效性结果有限。
仓库提供固定 revision 下的 SKILL.md、生成 schema 元数据、配置模板、评估任务和一份 benchmark 报告,关键声明具有一定审计线索。扣分原因是仅一个评估任务、无覆盖关键路径的提交测试套件或真实 CI 执行证据,benchmark 结果本身也未提供可复现运行细节;因此静态证据不足以支持高分。
- 默认模板启用 Weights & Biases,使用前应确认是否允许向外部服务发送运行元数据或代码信息。
- 训练和部署会产生 GPU、容器、模型权重及可能的云存储访问成本;文档未提供回滚、清理或失败恢复步骤。
- 应先核对仓库实际目录结构、生成 schema/template 是否齐全,以及 Docker、NVIDIA Container Toolkit、TAO 容器和模型权重在目标网络环境中的可用性。
- Apache-2.0 技能元数据与仓库对文档采用 CC-BY-4.0 的说明需要在发布或再分发前澄清。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO Toolkit 中的 Mask Grounding DINO,用于文本引导的开放集实例分割。它覆盖训练、评估、推理、导出、量化及 TensorRT 部署流程。训练阶段默认支持 AutoML,并要求使用规定的数据源配置;非训练操作保留在模型技能内执行。运行环境需要 Docker 和 nvidia-container-toolkit,建议每张 GPU 具备 24GB 以上显存。
读取训练策略、模型信息、动作 schema 和 spec 模板;根据动作构造训练、验证、评估、推理及量化所需的数据源路径;执行或路由 TAO Mask Grounding DINO 的 train、evaluate、inference、export 和 quantize 操作;在启用 AutoML 且相关 schema 和模板存在时,通过 tao-run-automl 运行训练;为 TensorRT 引擎生成、TensorRT 评估和 TensorRT 推理读取部署参考;处理父任务模型、输出目录、ONNX 文件和 TensorRT 引擎等参数映射。
- 使用自定义 ODVG 或 COCO 数据训练文本提示驱动的实例分割模型的计算机视觉工程师。
- 需要用验证集评估已训练 Mask Grounding DINO 检查点的模型开发者。
- 希望输入诸如“person”或“bicycle”等文本提示执行开放词汇分割推理的研究人员。
- 需要导出 ONNX、量化模型或生成 TensorRT 引擎以进行 GPU 部署的工程师。
这个 Skill 有哪些优点和局限?
- 覆盖从训练到导出、量化和 TensorRT 部署的完整模型工作流。
- 支持开放词汇、文本提示驱动的实例分割。
- 提供动作 schema、spec 模板、参数映射和常见错误处理说明。
- 支持 AutoML,并明确使用 val_loss 作为最小化指标。
- 要求 Docker、nvidia-container-toolkit 和 NVIDIA GPU;建议每张 GPU 使用 24GB 以上显存。
- 掩码预测头比 Grounding DINO 额外占用显存,显存不足时需要减小 batch_size。
- 数据源配置对每个动作都是强制的,使用者需要准备 ODVG、COCO 或指定归档文件。
- 提供材料未说明该单项技能的独立测试套件或具体性能基准。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI:npx skills add nvidia/skills --skill tao-train-mask-grounding-dino --yes。CLI 会处理安装目标;无需手动克隆仓库或复制技能目录。运行环境还需要 Docker 和 nvidia-container-toolkit。
如何使用这个 Skill?
安装后,向兼容的 Agent Skills 客户端提出“train Mask Grounding DINO”或“运行文本提示驱动的实例分割推理”等请求。训练、评估、推理和量化时必须提供对应的数据源路径;训练可通过 automl_policy: on 或 off 控制本次运行是否使用 AutoML。TensorRT 相关操作还需使用该技能 references/tao-deploy-mask-grounding-dino.md 中的部署流程。
这个 Skill 与同类方案有什么区别?
该技能明确以 Grounding DINO 为基础并复用其部分训练设置;Mask Grounding DINO 增加了掩码预测头,因此适合实例分割,而不是仅使用 Grounding DINO 的检测工作流。