TAO 视频推理标注流水线
把原始视频转换为带推理链的训练数据。
文档要求先确认视频、领域、模式和 VLM 端点,并说明 Gemini/OpenAI-compatible 数据流;但允许 Read/Bash/Write 权限较宽,未明确外发视频的用户确认、敏感视频处理、最小权限、失败回滚或密钥不得写入配置。NVIDIA 作者和 Apache-2.0 标注提供了归属证据,但不足以补足这些控制,因此扣分。
流水线步骤、配置、恢复机制和常见错误均有说明,且提示检查中间 JSONL;但未提供覆盖关键路径的测试套件或 CI 复现证据,并存在若干文档不一致,例如 LLM 步骤描述、Step 4 任务名称与 qa_types 名称不完全一致。静态证据仅支持有限的可运行性,因此扣分。
目标用户、输入视频/JSONL、领域分支、模式和触发词较清楚,也提供 general、traffic、warehouse 和 custom 路径;但未声明中文输出或中文场景适配,Gemini 等核心端点可能受中国大陆网络可达性限制,自托管路径仍需额外部署,非适用边界不够完整,因此扣分。
信息架构较完整,包含快速开始、配置参考、领域适配、错误模式、输出格式、版本和 Apache-2.0 许可;但缺少 SKILL.md 推荐的 Instructions/Examples 分节,作者格式不完整,版本仅为 0.1.0,未给出明确 changelog、维护责任人和更新流程。BENCHMARK 中还记录了目录层级和 schema 问题,因此扣分。
文档明确描述从视频到 captions、结构化描述、QA JSON/JSONL 的完整目标和输出 envelope,提交的 benchmark 报告也显示一次评估通过;但评估仅有一个计划说明任务,未验证真实视频生成质量、成本、错误恢复或相较替代方案的收益。静态校准下只能给予中等分数,因此扣分。
存在固定修订、配置/错误参考、示例提示词和提交的 benchmark 报告,部分主张可审计;但 benchmark 样本仅一个、无负向任务,缺少覆盖关键路径的测试、CI 或多来源复核,且本次未执行任何内容。静态证据有限,因此扣分。
- 运行前应明确确认视频是否可发送到所选外部 VLM/LLM,并避免将 API 密钥写入 YAML;优先使用环境变量或受控密钥管理。
- 生成的 Chain-of-Thought 推理痕迹可能包含敏感视频内容、身份信息或错误推断,应进行人工抽样、隐私审查和数据集许可核验。
- 在中国大陆环境中应先验证 Gemini 等端点的网络可达性,并准备经批准的本地或 OpenAI-compatible 服务替代方案。
- 首次运行应严格限制为小规模 pilot,并检查 captions、descriptions 和 QA 的事实准确性后再扩大处理。
这个 Skill 能做什么,适合哪些场景?
该技能使用 VLM 和 LLM 将原始视频转换为视频理解模型训练数据。流水线可生成多级字幕、结构化描述,以及带推理轨迹的选择题、二元题和开放题。它支持通用、交通、仓库和自定义领域,并可按步骤执行、断点续跑。使用者需要 Docker、NVIDIA 容器工具链和至少一个 Gemini 或 OpenAI 兼容的视频模型端点。
读取视频目录或包含 video_path 的 JSONL 文件,递归处理 MP4、AVI、MOV 和 MKV 视频。可选地筛选并分类视频,然后调用 VLM 生成全局字幕、密集字幕、分段字幕和异常片段字幕;随后调用 LLM 合成结构化描述并生成 MCQ、二元题和开放题。最后解析为每个任务一个 JSON 文件,使用 tao-vl-reason-v1.0 格式,并写入 results_dir 下的分步 JSONL 和任务 JSON 输出。
- 视频理解团队需要从一批原始视频构建带时间信息的字幕和问答训练集。
- 数据工程师需要自动标注包含正常与异常样本的混合视频数据集。
- 研究人员希望为视频模型生成带步骤化推理轨迹的选择题、二元题或开放题。
- 交通监控或仓库监控团队需要使用领域提示词生成更贴合摄像头场景的标注。
- 首次运行或修改提示词的用户需要先用 5–10 个视频进行质量试运行。
这个 Skill 有哪些优点和局限?
- 覆盖从视频字幕到描述、问答和最终 JSON 数据集的完整多步骤流程。
- 支持 Gemini 和 OpenAI 兼容端点,并允许文本步骤使用更小、更便宜的 LLM。
- 支持通用、交通、仓库和自定义领域提示词。
- 每个步骤可单独选择,且已处理视频会自动跳过,便于断点续跑。
- 依赖 Docker、nvidia-container-toolkit、ffmpeg/ffprobe 和外部 VLM 端点。
- 调用模型会受 API 访问权限、费用和速率限制影响;并行度需要结合 API 限制调整。
- 输出质量依赖前期字幕质量,提示词或自定义领域通常需要人工检查和迭代。
- 源材料未提供独立测试套件、性能基准或不同硬件平台的验证结果。
如何安装这个 Skill?
使用集合 README 中给出的 Skills CLI 安装命令:npx skills add nvidia/skills --skill tao-generate-video-reasoning-annotations --yes。该仓库是包含 324 个技能的集合;这里应只安装并使用 tao-generate-video-reasoning-annotations。源材料未说明该技能的独立手工复制路径或额外安装包步骤。
如何使用这个 Skill?
先确认视频路径、视频领域、数据模式和 VLM/LLM 端点。然后在 TAO Toolkit 容器中执行:auto_label generate -e /path/to/spec.yaml results_dir=/results video_reasoning_annotation.data.video_root=/videos video_reasoning_annotation.vlm.gemini.api_key=$GOOGLE_API_KEY video_reasoning_annotation.workflow.mode=auto。首次运行、使用自定义领域或修改提示词时,建议先处理 5–10 个视频,并检查 results_dir/step_1a_caption/captions.jsonl 与 results_dir/step_3_qa/qa_output.jsonl。
这个 Skill 与同类方案有什么区别?
该技能明确支持两类模型端点:默认的 Gemini,以及提供 base_url、model_name 和 api_key 的 OpenAI 兼容端点。步骤 0–1 需要模型查看视频,步骤 2–3 仅处理文本,因此两类步骤可以使用不同成本和能力的模型。