TAO 图像指代表达定位
将图像和文字描述转换为带像素级边界框的短语定位标注。
文档明确要求用户选择 VLM、提供输入路径,并说明 API 密钥可通过环境变量传入;检查点支持重复运行。但图像和字幕会发送到外部或自建 VLM,缺少数据保留、敏感内容处理、端点信任边界和执行前确认;依赖使用 vLLM latest,缺少依赖完整性与回滚方案,因此扣分。
输入、两步流程、检查点、重处理选项和常见错误均有说明,正常路径较清楚。静态材料没有覆盖关键路径的可执行测试,且配置中的默认 Gemini 模型与前文推荐模型不一致,部分参数和服务可用性依赖外部环境,因此按静态上限保守扣分。
目标用户、触发词、输入格式、输出结构和单步/全流程范围较明确。能力依赖 Docker、NVIDIA GPU、容器工具链及可用 VLM;没有中文使用说明或中文数据质量边界,Gemini/NIM 等海外或受限服务在中国大陆网络中的可达性未说明,因此扣分。
SKILL.md 采用分层说明并链接配置和 vLLM 参考,包含版本、许可证、所有者、示例、限制和错误模式;仓库提供维护与同步背景。但缺少专门 Examples 小节,作者格式不完整,版本变更记录、具体维护责任和更新路径不够明确,且存在元数据/目录规范问题,因此扣分。
流程能够产出清洗字幕、短语表达式和像素框 JSONL,并提供试运行和人工检查建议,核心价值明确。结果依赖 VLM 的定位质量,置信分数没有校准依据,仍需人工审核;仅有单个评测任务且静态审查未执行流水线,无法证明规模化结果的完整性和成本优势,因此扣分。
文档给出输入输出契约、错误模式和检查点布局,BENCHMARK.md 提供了一次外部评测报告。证据覆盖仅一个计划型任务,没有提交覆盖关键路径的测试套件或多来源复现材料;静态审查不能确认真实运行结果,因此扣分。
- 不要将图像或字幕发送到第三方 VLM,除非已确认数据合规、保留策略和端点信任边界。
- 先用少量样本人工检查表达式、边界框和尺寸字段,再扩展到全量数据;输出应视为需要审核的标注。
- 在中国大陆部署前确认 Gemini、NIM、模型仓库和镜像的网络可达性,并准备可访问的自建 OpenAI-compatible VLM。
- 固定并审查容器、模型和 vLLM 版本,避免直接使用 latest;发生错误时保留原始输入和已有检查点以便恢复。
这个 Skill 能做什么,适合哪些场景?
该技能通过两步 VLM 流程处理图像与描述配对数据。第一步清理描述并提取指代表达及字符跨度,第二步为每个表达生成像素空间边界框、置信分数和编号。它在 NVIDIA TAO Toolkit 容器中通过 auto_label CLI 运行,支持 Gemini 或 OpenAI 兼容的视觉语言模型端点。流程支持检查点续跑、分步执行和强制重新处理,适合生成指代表达与定位模型的训练标注。
读取 JSONL 中的 image_path、caption 以及可选的 image_id、width 和 height;解析相对图像路径;调用 Gemini 或 OpenAI 兼容的 VLM 完成表达提取和短语定位;输出清理后的描述、表达文本、字符跨度、名词短语、像素边界框、分数和 bbox_id;将结果写入各步骤的 annotations.jsonl,并保存逐样本检查点以便续跑。
- 需要为包含图像描述的数据集自动提取名词短语并生成指代表达标注的数据工程师。
- 正在构建指代表达理解或短语定位训练集、希望从现有图像描述生成边界框的数据科学家。
- 需要批量自动标注图像并检查少量样本质量后再扩展到完整数据集的计算机视觉团队。
- 已有 TAO Toolkit 环境和 VLM 服务、需要分别运行表达提取或边界框定位步骤的开发者。
这个 Skill 有哪些优点和局限?
- 完整覆盖表达提取和像素级短语定位两个步骤。
- 支持 Gemini 和 OpenAI 兼容端点,便于连接 NIM、TAO 推理微服务、vLLM 或其他兼容服务。
- 提供逐样本检查点、断点续跑、并行工作线程和分步执行。
- 输出 JSONL,包含清理描述、字符跨度、边界框和分数,适合后续数据处理。
- 必须运行 Docker 和 nvidia-container-toolkit,并使用 NVIDIA TAO Toolkit 容器。
- 至少需要一个能够处理图像输入的 VLM 端点及相应 API 访问权限。
- 定位质量取决于所选 VLM;源文档建议先进行 5 至 10 张图像的试运行和人工检查。
- 输入缺少 width 或 height 时,边界框裁剪默认使用 1920×1080;源材料未提供该技能独立测试结果或性能基准。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装指定技能:npx skills add nvidia/skills --skill tao-generate-image-grounding --yes。README 未说明该单个技能的独立安装包或额外安装命令;运行时还需要 Docker、nvidia-container-toolkit、指定 TAO Toolkit 容器以及 VLM 端点。
如何使用这个 Skill?
准备每行包含 image_path 和 caption 的 JSONL 文件,必要时设置图像根目录和 VLM 访问参数。可生成默认规格并将 autolabel_type 设为 image_grounding,然后运行:auto_label generate -e /path/to/spec.yaml results_dir=/results image_grounding.data.input_jsonl=/data/captions.jsonl image_grounding.data.image_root=/data/images image_grounding.vlm.gemini.api_key=$GOOGLE_API_KEY。workflow.steps 可设为 ["0","1"]、["0"] 或 ["1"];仅运行步骤 1 时必须已有步骤 0 输出。默认复用检查点,如需从头处理则设置 image_grounding.workflow.force_reprocess=true。
这个 Skill 与同类方案有什么区别?
该技能在 VLM 后端方面支持 Gemini 与 OpenAI 兼容端点两类方案;后者可连接 NIM、TAO 推理微服务、vLLM 或其他兼容服务。源材料没有提供与独立传统定位算法的功能或性能对比。