数据与分析 ✓ NVIDIA · 官方 image-groundingbounding-boxesphrase-groundingauto-labelingvision-language-modelstao-toolkit

TAO 图像指代表达定位

将图像和文字描述转换为带像素级边界框的短语定位标注。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全16 / 25 · 3.2/5

文档明确要求用户选择 VLM、提供输入路径,并说明 API 密钥可通过环境变量传入;检查点支持重复运行。但图像和字幕会发送到外部或自建 VLM,缺少数据保留、敏感内容处理、端点信任边界和执行前确认;依赖使用 vLLM latest,缺少依赖完整性与回滚方案,因此扣分。

可靠稳定8 / 20 · 2.0/5

输入、两步流程、检查点、重处理选项和常见错误均有说明,正常路径较清楚。静态材料没有覆盖关键路径的可执行测试,且配置中的默认 Gemini 模型与前文推荐模型不一致,部分参数和服务可用性依赖外部环境,因此按静态上限保守扣分。

适用触发9 / 15 · 3.0/5

目标用户、触发词、输入格式、输出结构和单步/全流程范围较明确。能力依赖 Docker、NVIDIA GPU、容器工具链及可用 VLM;没有中文使用说明或中文数据质量边界,Gemini/NIM 等海外或受限服务在中国大陆网络中的可达性未说明,因此扣分。

规范维护9 / 15 · 3.0/5

SKILL.md 采用分层说明并链接配置和 vLLM 参考,包含版本、许可证、所有者、示例、限制和错误模式;仓库提供维护与同步背景。但缺少专门 Examples 小节,作者格式不完整,版本变更记录、具体维护责任和更新路径不够明确,且存在元数据/目录规范问题,因此扣分。

有效结果6 / 15 · 2.0/5

流程能够产出清洗字幕、短语表达式和像素框 JSONL,并提供试运行和人工检查建议,核心价值明确。结果依赖 VLM 的定位质量,置信分数没有校准依据,仍需人工审核;仅有单个评测任务且静态审查未执行流水线,无法证明规模化结果的完整性和成本优势,因此扣分。

证据核验4 / 10 · 2.0/5

文档给出输入输出契约、错误模式和检查点布局,BENCHMARK.md 提供了一次外部评测报告。证据覆盖仅一个计划型任务,没有提交覆盖关键路径的测试套件或多来源复现材料;静态审查不能确认真实运行结果,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 不要将图像或字幕发送到第三方 VLM,除非已确认数据合规、保留策略和端点信任边界。
  • 先用少量样本人工检查表达式、边界框和尺寸字段,再扩展到全量数据;输出应视为需要审核的标注。
  • 在中国大陆部署前确认 Gemini、NIM、模型仓库和镜像的网络可达性,并准备可访问的自建 OpenAI-compatible VLM。
  • 固定并审查容器、模型和 vLLM 版本,避免直接使用 latest;发生错误时保留原始输入和已有检查点以便恢复。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能通过两步 VLM 流程处理图像与描述配对数据。第一步清理描述并提取指代表达及字符跨度,第二步为每个表达生成像素空间边界框、置信分数和编号。它在 NVIDIA TAO Toolkit 容器中通过 auto_label CLI 运行,支持 Gemini 或 OpenAI 兼容的视觉语言模型端点。流程支持检查点续跑、分步执行和强制重新处理,适合生成指代表达与定位模型的训练标注。

读取 JSONL 中的 image_path、caption 以及可选的 image_id、width 和 height;解析相对图像路径;调用 Gemini 或 OpenAI 兼容的 VLM 完成表达提取和短语定位;输出清理后的描述、表达文本、字符跨度、名词短语、像素边界框、分数和 bbox_id;将结果写入各步骤的 annotations.jsonl,并保存逐样本检查点以便续跑。

  1. 需要为包含图像描述的数据集自动提取名词短语并生成指代表达标注的数据工程师。
  2. 正在构建指代表达理解或短语定位训练集、希望从现有图像描述生成边界框的数据科学家。
  3. 需要批量自动标注图像并检查少量样本质量后再扩展到完整数据集的计算机视觉团队。
  4. 已有 TAO Toolkit 环境和 VLM 服务、需要分别运行表达提取或边界框定位步骤的开发者。

这个 Skill 有哪些优点和局限?

优点
  • 完整覆盖表达提取和像素级短语定位两个步骤。
  • 支持 Gemini 和 OpenAI 兼容端点,便于连接 NIM、TAO 推理微服务、vLLM 或其他兼容服务。
  • 提供逐样本检查点、断点续跑、并行工作线程和分步执行。
  • 输出 JSONL,包含清理描述、字符跨度、边界框和分数,适合后续数据处理。
局限
  • 必须运行 Docker 和 nvidia-container-toolkit,并使用 NVIDIA TAO Toolkit 容器。
  • 至少需要一个能够处理图像输入的 VLM 端点及相应 API 访问权限。
  • 定位质量取决于所选 VLM;源文档建议先进行 5 至 10 张图像的试运行和人工检查。
  • 输入缺少 width 或 height 时,边界框裁剪默认使用 1920×1080;源材料未提供该技能独立测试结果或性能基准。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装指定技能:npx skills add nvidia/skills --skill tao-generate-image-grounding --yes。README 未说明该单个技能的独立安装包或额外安装命令;运行时还需要 Docker、nvidia-container-toolkit、指定 TAO Toolkit 容器以及 VLM 端点。

如何使用这个 Skill?

准备每行包含 image_path 和 caption 的 JSONL 文件,必要时设置图像根目录和 VLM 访问参数。可生成默认规格并将 autolabel_type 设为 image_grounding,然后运行:auto_label generate -e /path/to/spec.yaml results_dir=/results image_grounding.data.input_jsonl=/data/captions.jsonl image_grounding.data.image_root=/data/images image_grounding.vlm.gemini.api_key=$GOOGLE_API_KEY。workflow.steps 可设为 ["0","1"]、["0"] 或 ["1"];仅运行步骤 1 时必须已有步骤 0 输出。默认复用检查点,如需从头处理则设置 image_grounding.workflow.force_reprocess=true。

这个 Skill 与同类方案有什么区别?

该技能在 VLM 后端方面支持 Gemini 与 OpenAI 兼容端点两类方案;后者可连接 NIM、TAO 推理微服务、vLLM 或其他兼容服务。源材料没有提供与独立传统定位算法的功能或性能对比。

常见问题

它能否只运行表达提取或只运行边界框定位?
可以。workflow.steps 支持 ["0"]、["1"] 或完整的 ["0","1"];只运行步骤 1 时必须存在步骤 0 的 annotations.jsonl。
需要哪些外部服务?
需要 Gemini API key,或能够处理图像输入的 OpenAI 兼容 VLM 端点;也可以使用 NIM、TAO 推理微服务、vLLM 或其他兼容服务。
重新运行会不会重复处理全部样本?
默认会读取逐样本检查点并跳过已完成记录。将 image_grounding.workflow.force_reprocess=true 可忽略检查点并从头处理。
输出的边界框是什么格式?
步骤 1 输出中的每个实例包含像素空间 bbox [x1,y1,x2,y2]、0.0 到 1.0 的 score,以及 bbox_id。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO 图像指代表达式标注管线

将图像和 KITTI 框标注转换为可定位的指代表达式数据。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

开发与工程 ✓ NVIDIA · 官方

NeMo AutoModel 模型接入指南

指导开发者将新的 LLM、MoE 或 VLM 架构接入 NeMo AutoModel。

数据与分析 ✓ NVIDIA · 官方

PAS 人员属性搜索工作流

在 OSMO 上扩增人员图像并自动生成属性标注。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVDINOv2 视觉表征训练

用无标签自蒸馏训练可复用的视觉特征骨干。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO VLM 二分类差距分析

从 VLM 是非预测中提取误报和漏报样本,支持后续根因分析。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO 姿态分类

用 ST-GCN 将姿态关键点序列分类为动作类别。

相关 Skills