数据与分析 ✓ NVIDIA · 官方 image-annotationreferring-expressionkittibounding-boxesvlmtao-toolkit

TAO 图像指代表达式标注管线

将图像和 KITTI 框标注转换为可定位的指代表达式数据。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全14 / 25 · 2.8/5

技能明确要求用户选择并提供 VLM 端点,支持自托管服务,并将结果写入指定 results_dir;但 Read/Bash/Write 权限较宽,图像会发送至外部 VLM,未充分说明数据保留、敏感图像处理、最小权限、回滚或逐次执行确认,因此扣分。许可证、NVIDIA 归属和来源说明提供了部分可追溯性。

可靠稳定8 / 20 · 2.0/5

文档覆盖输入、配置、缓存、重跑和多类错误模式,正常路径较清晰;但仅静态阅读,缺少覆盖关键路径的提交测试,存在模型默认值与推荐值不一致、格式/参数依赖未完全验证,以及部分输入被静默跳过的问题。按静态校准不超过 10 分。

适用触发8 / 15 · 2.7/5

目标用户、KITTI 输入、输出结构、触发词和四步流程较明确,也提供 Gemini、OpenAI 兼容端点及自托管选项;但非适用范围、中文语言行为和大陆网络可达性未明确,核心云端端点可能依赖境外服务,因此扣分。

规范维护9 / 15 · 3.0/5

SKILL.md、配置参考、vLLM 指南、skill_info.yaml 和 skill-card 形成了较好的分层文档,包含版本、许可证、所有者、输出和维护/报告路径;但缺少推荐的 Examples 部分,作者格式不规范,缺少明确 changelog,且许可证元数据为 NOASSERTION 与文档声明不一致。

有效结果6 / 15 · 2.0/5

流程目标、步骤产物、JSONL/legacy 输出及试运行建议明确,理论上可完成自动生成标注;但输出依赖 VLM,定位与描述质量可能错误,缺少可核验的代表性产物和静态可验证的关键结果,仍需人工审查,因此未超过静态上限 7 分。

证据核验3 / 10 · 1.5/5

存在一份单任务 benchmark 报告及评测配置,提供有限的安全、正确性和发现性证据;但没有提交测试套件、实际输出、跨数据集复现或独立第三方 corroboration,报告本身不足以支持高可验证性。按静态校准不超过 5 分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前确认图像是否可发送到所选外部 VLM、其数据保留策略和 API 密钥范围;优先使用受控的自托管端点处理敏感数据。
  • 先在小样本上人工检查区域描述、分组表达式和双重检查结果;VLM 可能产生错误或过度修正的边界框。
  • 修复模型默认值与推荐值不一致、补充 Examples、明确版本变更记录,并避免对格式错误的 KITTI 行静默跳过。
  • 在中国大陆部署前验证 Gemini/NIM 等端点的网络可达性;不可达时使用合规的本地或可访问的 OpenAI 兼容服务。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能使用单个视觉语言模型处理图像与 KITTI 格式边界框,生成区域描述、整体场景描述和与边界框关联的分组指代表达式。可选的复核步骤会重新检查框与表达式的匹配,并删除或收紧错误框。结果写入统一的 annotations.jsonl,也可输出兼容旧版工具的文本文件。运行需要 Docker、nvidia-container-toolkit 和至少一个支持图像输入的 VLM 端点。

读取图像目录中的 JPG、JPEG 或 PNG 文件及对应的 KITTI .txt 标签,解析对象类型和边界框坐标,并使用 Gemini 或 OpenAI 兼容端点执行四步流程:为每个框生成区域描述,生成整体图像描述,将对象分组为带框列表的 grounding 表达式,并可选地执行双重检查。通过 TAO Toolkit 容器中的 auto_label generate CLI 运行,将种子记录、各步骤 annotations.jsonl、最终 annotations.jsonl 以及可选的 legacy .txt.stepN 文件写入 results_dir。

  1. 负责自动驾驶或交通图像数据集的团队,需要从已有 KITTI 框标注生成对象指代表达式。
  2. 构建视觉指代数据集的研究人员,需要为每张图像生成区域描述和分组 grounding 短语。
  3. 需要批量预标注场景图像、并通过 VLM 复核框匹配质量的数据工程师。
  4. 已有部分 annotations.jsonl、希望从中恢复或继续执行后续标注步骤的用户。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖区域描述、场景描述、分组 grounding 和可选复核的完整流程。
  • 支持 Gemini 及 OpenAI 兼容的 VLM 端点。
  • 支持按步骤缓存并恢复处理,也支持 JSONL 和 legacy 两种输出形式。
  • 适合直接处理 KITTI 格式边界框。
局限
  • 必须提供图像输入、KITTI 标签和可用的图像型 VLM 端点;没有端点时无法运行。
  • 依赖 NVIDIA TAO Toolkit 容器、Docker 和 nvidia-container-toolkit。
  • SKILL.md 未提供性能基准、测试套件或具体平台兼容性验证结果。
  • VLM 生成质量取决于模型、分辨率、输出 token 设置和 API 速率限制。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装指定技能:npx skills add nvidia/skills --skill tao-generate-referring-expressions --yes。README 未说明其他独立安装步骤;实际运行仍需准备 Docker、nvidia-container-toolkit、TAO Toolkit 容器和 VLM 端点。

如何使用这个 Skill?

准备图像目录和 KITTI 标签目录,选择 Gemini 或 OpenAI 兼容 VLM 端点,然后运行:auto_label generate -e /path/to/spec.yaml results_dir=/results image_referring_expression.data.image_dir=/data/images image_referring_expression.data.kitti_label_dir=/data/labels image_referring_expression.vlm.gemini.api_key=$GOOGLE_API_KEY。默认可执行步骤 0、1、2、3;也可通过 workflow.steps 选择子集。建议先用 5–10 张图像试运行,检查 step_0、step_2 和 step_3 的结果后再扩展到完整数据集。

常见问题

是否必须生成整体场景描述?
不是。可以使用 ["0","2","3"] 跳过步骤 1;步骤 2 会退回到仅基于图像的上下文。
可以使用哪些 VLM?
支持 Gemini,也支持任何能够接收图像输入的 OpenAI 兼容端点,包括 NIM、TAO 推理微服务、vLLM 或其他自定义端点。
输出文件有哪些?
核心输出是 results_dir/annotations.jsonl,并包含各步骤目录中的 annotations.jsonl;将 workflow.output_format 设为 legacy 或 both 时,还会写入 .txt.stepN 文件。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO 图像指代表达定位

将图像和文字描述转换为带像素级边界框的短语定位标注。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

数据与分析 ✓ NVIDIA · 官方

TAO VLM 二分类差距分析

从 VLM 是非预测中提取误报和漏报样本,支持后续根因分析。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO 姿态分类

用 ST-GCN 将姿态关键点序列分类为动作类别。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO 度量学习识别

为细粒度视觉识别训练可用于检索匹配的图像嵌入模型。

相关 Skills