TAO 图像指代表达式标注管线
将图像和 KITTI 框标注转换为可定位的指代表达式数据。
技能明确要求用户选择并提供 VLM 端点,支持自托管服务,并将结果写入指定 results_dir;但 Read/Bash/Write 权限较宽,图像会发送至外部 VLM,未充分说明数据保留、敏感图像处理、最小权限、回滚或逐次执行确认,因此扣分。许可证、NVIDIA 归属和来源说明提供了部分可追溯性。
文档覆盖输入、配置、缓存、重跑和多类错误模式,正常路径较清晰;但仅静态阅读,缺少覆盖关键路径的提交测试,存在模型默认值与推荐值不一致、格式/参数依赖未完全验证,以及部分输入被静默跳过的问题。按静态校准不超过 10 分。
目标用户、KITTI 输入、输出结构、触发词和四步流程较明确,也提供 Gemini、OpenAI 兼容端点及自托管选项;但非适用范围、中文语言行为和大陆网络可达性未明确,核心云端端点可能依赖境外服务,因此扣分。
SKILL.md、配置参考、vLLM 指南、skill_info.yaml 和 skill-card 形成了较好的分层文档,包含版本、许可证、所有者、输出和维护/报告路径;但缺少推荐的 Examples 部分,作者格式不规范,缺少明确 changelog,且许可证元数据为 NOASSERTION 与文档声明不一致。
流程目标、步骤产物、JSONL/legacy 输出及试运行建议明确,理论上可完成自动生成标注;但输出依赖 VLM,定位与描述质量可能错误,缺少可核验的代表性产物和静态可验证的关键结果,仍需人工审查,因此未超过静态上限 7 分。
存在一份单任务 benchmark 报告及评测配置,提供有限的安全、正确性和发现性证据;但没有提交测试套件、实际输出、跨数据集复现或独立第三方 corroboration,报告本身不足以支持高可验证性。按静态校准不超过 5 分。
- 执行前确认图像是否可发送到所选外部 VLM、其数据保留策略和 API 密钥范围;优先使用受控的自托管端点处理敏感数据。
- 先在小样本上人工检查区域描述、分组表达式和双重检查结果;VLM 可能产生错误或过度修正的边界框。
- 修复模型默认值与推荐值不一致、补充 Examples、明确版本变更记录,并避免对格式错误的 KITTI 行静默跳过。
- 在中国大陆部署前验证 Gemini/NIM 等端点的网络可达性;不可达时使用合规的本地或可访问的 OpenAI 兼容服务。
这个 Skill 能做什么,适合哪些场景?
该技能使用单个视觉语言模型处理图像与 KITTI 格式边界框,生成区域描述、整体场景描述和与边界框关联的分组指代表达式。可选的复核步骤会重新检查框与表达式的匹配,并删除或收紧错误框。结果写入统一的 annotations.jsonl,也可输出兼容旧版工具的文本文件。运行需要 Docker、nvidia-container-toolkit 和至少一个支持图像输入的 VLM 端点。
读取图像目录中的 JPG、JPEG 或 PNG 文件及对应的 KITTI .txt 标签,解析对象类型和边界框坐标,并使用 Gemini 或 OpenAI 兼容端点执行四步流程:为每个框生成区域描述,生成整体图像描述,将对象分组为带框列表的 grounding 表达式,并可选地执行双重检查。通过 TAO Toolkit 容器中的 auto_label generate CLI 运行,将种子记录、各步骤 annotations.jsonl、最终 annotations.jsonl 以及可选的 legacy .txt.stepN 文件写入 results_dir。
- 负责自动驾驶或交通图像数据集的团队,需要从已有 KITTI 框标注生成对象指代表达式。
- 构建视觉指代数据集的研究人员,需要为每张图像生成区域描述和分组 grounding 短语。
- 需要批量预标注场景图像、并通过 VLM 复核框匹配质量的数据工程师。
- 已有部分 annotations.jsonl、希望从中恢复或继续执行后续标注步骤的用户。
这个 Skill 有哪些优点和局限?
- 覆盖区域描述、场景描述、分组 grounding 和可选复核的完整流程。
- 支持 Gemini 及 OpenAI 兼容的 VLM 端点。
- 支持按步骤缓存并恢复处理,也支持 JSONL 和 legacy 两种输出形式。
- 适合直接处理 KITTI 格式边界框。
- 必须提供图像输入、KITTI 标签和可用的图像型 VLM 端点;没有端点时无法运行。
- 依赖 NVIDIA TAO Toolkit 容器、Docker 和 nvidia-container-toolkit。
- SKILL.md 未提供性能基准、测试套件或具体平台兼容性验证结果。
- VLM 生成质量取决于模型、分辨率、输出 token 设置和 API 速率限制。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装指定技能:npx skills add nvidia/skills --skill tao-generate-referring-expressions --yes。README 未说明其他独立安装步骤;实际运行仍需准备 Docker、nvidia-container-toolkit、TAO Toolkit 容器和 VLM 端点。
如何使用这个 Skill?
准备图像目录和 KITTI 标签目录,选择 Gemini 或 OpenAI 兼容 VLM 端点,然后运行:auto_label generate -e /path/to/spec.yaml results_dir=/results image_referring_expression.data.image_dir=/data/images image_referring_expression.data.kitti_label_dir=/data/labels image_referring_expression.vlm.gemini.api_key=$GOOGLE_API_KEY。默认可执行步骤 0、1、2、3;也可通过 workflow.steps 选择子集。建议先用 5–10 张图像试运行,检查 step_0、step_2 和 step_3 的结果后再扩展到完整数据集。