数据与分析 ✓ NVIDIA · 官方 gap-analysisvlm-evaluationbinary-classificationfalse-positivefalse-negativeroot-cause-analysistao-toolkit

TAO VLM 二分类差距分析

从 VLM 是非预测中提取误报和漏报样本,支持后续根因分析。

FollowSkills 评估 · FSRS-2.0
不推荐
51/ 100 五分制 2.6 / 5
信任安全15 / 25 · 3.0/5

仅声明 Read、Bash,并限定为 Docker/NVIDIA 容器中的 gap_analysis;无凭据需求、网络调用或明显破坏性操作,且输出路径由用户指定。但会读取用户提供的文件并创建输出目录,未说明敏感视频/预测数据处理、执行前确认、隔离边界或回滚机制,因此扣分。

可靠稳定8 / 20 · 2.0/5

SKILL.md、skill_info.yaml 与错误模式基本一致,输入、输出和异常情况有说明;但未提供实现代码、依赖版本、关键路径测试或对解析歧义和容器失败的可诊断反馈。基准报告只有单个任务,静态审查不足以证明运行稳定性,因此限制在静态上限内。

适用触发9 / 15 · 3.0/5

目标用户、触发短语、输入格式、可选 videos_dir、输出文件和非匹配样本行为均较清楚。未说明更广泛的分类格式、非视频路径或中文输入支持;依赖 Docker、NVIDIA Container Toolkit 和 TAO 环境,部署边界证据有限,因此扣分。

规范维护9 / 15 · 3.0/5

具备规范 frontmatter、Apache-2.0、作者、版本、标签、参数表、示例、错误模式、skill card 和引用信息。缺少独立 Examples 章节,版本变更、维护责任和更新路径不清晰;基准也记录了嵌套层级和作者格式问题,因此扣分。

有效结果6 / 15 · 2.0/5

核心目标明确,能生成 JSONL 失败样本及文本汇总,并为下游 RCCA 提供明确文件。评估报告显示有限基准中的正确性和效果较高,但只有一个内部任务且没有实际输出样例或代码验证;“无 gap 时不写文件”也可能降低下游直接可用性,因此未接近满分。

证据核验4 / 10 · 2.0/5

存在 revision 内的 skill_info、评估任务、基准指标和输出契约,可审计关键声明。证据主要来自单个内部静态/评估报告,没有该技能自身的测试套件、第三方复核或多场景复现,因此仅给有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行依赖 Docker、NVIDIA Container Toolkit 和 TAO Toolkit 数据服务容器;当前材料未证明这些依赖在目标环境中可用。
  • 预测和视频路径可能包含敏感数据;文档未说明日志、容器挂载、权限范围或数据清理策略。
  • yes/no 解析遇到同时包含或都不包含两类词的样本会跳过,可能造成漏报;应在使用前检查警告并审核输入格式。
  • 基准仅含一个内部任务,不能替代对真实 FP/FN 数据和异常输入的端到端验证。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能读取 VLM 二元分类预测 JSON,并将模型响应与真实标签进行比较。它识别假阳性和假阴性样本,输出结构化 JSONL 文件及计数报告。输入必须是包含 video_id、response 和 gt 字段的 JSON 数组。该技能适合已在 TAO Toolkit 数据服务容器中运行 VLM 评估、需要定位失败案例的团队。

运行 TAO Toolkit 的 vlm_bcq gap_analysis action,读取 predictions_json;使用单词边界匹配从 response 和 gt 中识别 yes/no;解析相对 video_id 时可使用 videos_dir;将假阳性和假阴性样本写入 kpi_gaps.jsonl,并将 FP/FN 总数写入 kpi_gaps_report.txt。若没有差距,则不写入文件并记录消息。

  1. VLM 评估工程师在完成是/否视频分类后,需要提取所有误报和漏报样本。
  2. 进行 DEFT 迭代的团队需要为后续 cosmos 生成或根因分析阶段提供失败案例。
  3. 使用相对视频路径的评估流程需要将 video_id 解析为绝对路径。
  4. 数据质量人员需要检查预测项是否缺少 video_id、response 或 gt 字段。

这个 Skill 有哪些优点和局限?

优点
  • 输出同时包含机器可读的 JSONL 失败案例和人类可读的计数报告。
  • 支持通过 videos_dir 解析相对视频路径。
  • 明确处理缺失字段、无效 JSON 数组和 yes/no 解析异常。
局限
  • 仅面向二分类的是/否预测,不能直接处理多类别任务。
  • response 或 gt 同时包含 yes 和 no,或两者都不包含时,样本会被跳过并发出警告。
  • 运行依赖 Docker、nvidia-container-toolkit 及 TAO Toolkit 数据服务容器。
  • 提供的材料没有该技能专属测试套件或基准结果。

如何安装这个 Skill?

使用仓库 README 提供的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-analyze-gaps-vlm-bcq --yes

README 未说明该技能的其他专用安装步骤;运行时仍需要 Docker、nvidia-container-toolkit 和 TAO Toolkit 数据服务容器。

如何使用这个 Skill?

准备一个 JSON 数组文件,每项至少包含 video_id、response 和 gt,然后运行:

gap_analysis vlm_bcq \
predictions_json=/path/to/results.json \
results_dir=/path/to/output/gaps

如果 video_id 是相对路径,再添加:

videos_dir=/path/to/videos/root

运行后查看 kpi_gaps_report.txt 中的 FP/FN 数量,并将 kpi_gaps.jsonl 提供给下游阶段。

常见问题

它能分析普通多类别 VLM 预测吗?
不能。该技能针对包含 yes/no 响应和真实标签的二分类问题。
输入文件必须满足什么格式?
必须是 JSON 数组,每项包含 video_id、response 和 gt;question 可作为输出中的问题字段使用。
找不到 predictions_json 时会发生什么?
会报告 FileNotFoundError;应检查文件路径。
没有 FP 或 FN 时会生成空文件吗?
不会;没有差距时不写入输出文件,并记录一条消息。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO ChangeNet 根因分析

基于图像证据定位 NVIDIA TAO Visual ChangeNet 分类实验的模型失败原因。

数据与分析 ✓ NVIDIA · 官方

TAO DEFT AOI 检测优化循环

为 PCB 视觉检测模型自动执行评估、缺陷增强、挖掘、重训与部署门控。

数据与分析 ✓ NVIDIA · 官方

TAO VCN 分类缺口分析

定位最脆弱的VCN分类样本并生成增强候选队列。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO 姿态分类

用 ST-GCN 将姿态关键点序列分类为动作类别。

数据与分析 ✓ NVIDIA · 官方

TAO 图像指代表达式标注管线

将图像和 KITTI 框标注转换为可定位的指代表达式数据。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 图像指代表达定位

将图像和文字描述转换为带像素级边界框的短语定位标注。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

相关 Skills