TAO VLM 二分类差距分析
从 VLM 是非预测中提取误报和漏报样本,支持后续根因分析。
仅声明 Read、Bash,并限定为 Docker/NVIDIA 容器中的 gap_analysis;无凭据需求、网络调用或明显破坏性操作,且输出路径由用户指定。但会读取用户提供的文件并创建输出目录,未说明敏感视频/预测数据处理、执行前确认、隔离边界或回滚机制,因此扣分。
SKILL.md、skill_info.yaml 与错误模式基本一致,输入、输出和异常情况有说明;但未提供实现代码、依赖版本、关键路径测试或对解析歧义和容器失败的可诊断反馈。基准报告只有单个任务,静态审查不足以证明运行稳定性,因此限制在静态上限内。
目标用户、触发短语、输入格式、可选 videos_dir、输出文件和非匹配样本行为均较清楚。未说明更广泛的分类格式、非视频路径或中文输入支持;依赖 Docker、NVIDIA Container Toolkit 和 TAO 环境,部署边界证据有限,因此扣分。
具备规范 frontmatter、Apache-2.0、作者、版本、标签、参数表、示例、错误模式、skill card 和引用信息。缺少独立 Examples 章节,版本变更、维护责任和更新路径不清晰;基准也记录了嵌套层级和作者格式问题,因此扣分。
核心目标明确,能生成 JSONL 失败样本及文本汇总,并为下游 RCCA 提供明确文件。评估报告显示有限基准中的正确性和效果较高,但只有一个内部任务且没有实际输出样例或代码验证;“无 gap 时不写文件”也可能降低下游直接可用性,因此未接近满分。
存在 revision 内的 skill_info、评估任务、基准指标和输出契约,可审计关键声明。证据主要来自单个内部静态/评估报告,没有该技能自身的测试套件、第三方复核或多场景复现,因此仅给有限分数。
- 执行依赖 Docker、NVIDIA Container Toolkit 和 TAO Toolkit 数据服务容器;当前材料未证明这些依赖在目标环境中可用。
- 预测和视频路径可能包含敏感数据;文档未说明日志、容器挂载、权限范围或数据清理策略。
- yes/no 解析遇到同时包含或都不包含两类词的样本会跳过,可能造成漏报;应在使用前检查警告并审核输入格式。
- 基准仅含一个内部任务,不能替代对真实 FP/FN 数据和异常输入的端到端验证。
这个 Skill 能做什么,适合哪些场景?
该技能读取 VLM 二元分类预测 JSON,并将模型响应与真实标签进行比较。它识别假阳性和假阴性样本,输出结构化 JSONL 文件及计数报告。输入必须是包含 video_id、response 和 gt 字段的 JSON 数组。该技能适合已在 TAO Toolkit 数据服务容器中运行 VLM 评估、需要定位失败案例的团队。
运行 TAO Toolkit 的 vlm_bcq gap_analysis action,读取 predictions_json;使用单词边界匹配从 response 和 gt 中识别 yes/no;解析相对 video_id 时可使用 videos_dir;将假阳性和假阴性样本写入 kpi_gaps.jsonl,并将 FP/FN 总数写入 kpi_gaps_report.txt。若没有差距,则不写入文件并记录消息。
- VLM 评估工程师在完成是/否视频分类后,需要提取所有误报和漏报样本。
- 进行 DEFT 迭代的团队需要为后续 cosmos 生成或根因分析阶段提供失败案例。
- 使用相对视频路径的评估流程需要将 video_id 解析为绝对路径。
- 数据质量人员需要检查预测项是否缺少 video_id、response 或 gt 字段。
这个 Skill 有哪些优点和局限?
- 输出同时包含机器可读的 JSONL 失败案例和人类可读的计数报告。
- 支持通过 videos_dir 解析相对视频路径。
- 明确处理缺失字段、无效 JSON 数组和 yes/no 解析异常。
- 仅面向二分类的是/否预测,不能直接处理多类别任务。
- response 或 gt 同时包含 yes 和 no,或两者都不包含时,样本会被跳过并发出警告。
- 运行依赖 Docker、nvidia-container-toolkit 及 TAO Toolkit 数据服务容器。
- 提供的材料没有该技能专属测试套件或基准结果。
如何安装这个 Skill?
使用仓库 README 提供的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-analyze-gaps-vlm-bcq --yes
README 未说明该技能的其他专用安装步骤;运行时仍需要 Docker、nvidia-container-toolkit 和 TAO Toolkit 数据服务容器。
如何使用这个 Skill?
准备一个 JSON 数组文件,每项至少包含 video_id、response 和 gt,然后运行:
gap_analysis vlm_bcq \
predictions_json=/path/to/results.json \
results_dir=/path/to/output/gaps
如果 video_id 是相对路径,再添加:
videos_dir=/path/to/videos/root
运行后查看 kpi_gaps_report.txt 中的 FP/FN 数量,并将 kpi_gaps.jsonl 提供给下游阶段。