数据与分析 ✓ NVIDIA · 官方 video-annotationvideo-captioningqa-generationchain-of-thoughtvlm-distillationtao-toolkitdocker

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

FollowSkills 评估 · FSRS-2.0
不推荐
47/ 100 五分制 2.4 / 5
信任安全12 / 25 · 2.4/5

文档要求先确认视频、领域、模式和 VLM 端点,并说明 Gemini/OpenAI-compatible 数据流;但允许 Read/Bash/Write 权限较宽,未明确外发视频的用户确认、敏感视频处理、最小权限、失败回滚或密钥不得写入配置。NVIDIA 作者和 Apache-2.0 标注提供了归属证据,但不足以补足这些控制,因此扣分。

可靠稳定7 / 20 · 1.8/5

流水线步骤、配置、恢复机制和常见错误均有说明,且提示检查中间 JSONL;但未提供覆盖关键路径的测试套件或 CI 复现证据,并存在若干文档不一致,例如 LLM 步骤描述、Step 4 任务名称与 qa_types 名称不完全一致。静态证据仅支持有限的可运行性,因此扣分。

适用触发8 / 15 · 2.7/5

目标用户、输入视频/JSONL、领域分支、模式和触发词较清楚,也提供 general、traffic、warehouse 和 custom 路径;但未声明中文输出或中文场景适配,Gemini 等核心端点可能受中国大陆网络可达性限制,自托管路径仍需额外部署,非适用边界不够完整,因此扣分。

规范维护10 / 15 · 3.3/5

信息架构较完整,包含快速开始、配置参考、领域适配、错误模式、输出格式、版本和 Apache-2.0 许可;但缺少 SKILL.md 推荐的 Instructions/Examples 分节,作者格式不完整,版本仅为 0.1.0,未给出明确 changelog、维护责任人和更新流程。BENCHMARK 中还记录了目录层级和 schema 问题,因此扣分。

有效结果6 / 15 · 2.0/5

文档明确描述从视频到 captions、结构化描述、QA JSON/JSONL 的完整目标和输出 envelope,提交的 benchmark 报告也显示一次评估通过;但评估仅有一个计划说明任务,未验证真实视频生成质量、成本、错误恢复或相较替代方案的收益。静态校准下只能给予中等分数,因此扣分。

证据核验4 / 10 · 2.0/5

存在固定修订、配置/错误参考、示例提示词和提交的 benchmark 报告,部分主张可审计;但 benchmark 样本仅一个、无负向任务,缺少覆盖关键路径的测试、CI 或多来源复核,且本次未执行任何内容。静态证据有限,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行前应明确确认视频是否可发送到所选外部 VLM/LLM,并避免将 API 密钥写入 YAML;优先使用环境变量或受控密钥管理。
  • 生成的 Chain-of-Thought 推理痕迹可能包含敏感视频内容、身份信息或错误推断,应进行人工抽样、隐私审查和数据集许可核验。
  • 在中国大陆环境中应先验证 Gemini 等端点的网络可达性,并准备经批准的本地或 OpenAI-compatible 服务替代方案。
  • 首次运行应严格限制为小规模 pilot,并检查 captions、descriptions 和 QA 的事实准确性后再扩大处理。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能使用 VLM 和 LLM 将原始视频转换为视频理解模型训练数据。流水线可生成多级字幕、结构化描述,以及带推理轨迹的选择题、二元题和开放题。它支持通用、交通、仓库和自定义领域,并可按步骤执行、断点续跑。使用者需要 Docker、NVIDIA 容器工具链和至少一个 Gemini 或 OpenAI 兼容的视频模型端点。

读取视频目录或包含 video_path 的 JSONL 文件,递归处理 MP4、AVI、MOV 和 MKV 视频。可选地筛选并分类视频,然后调用 VLM 生成全局字幕、密集字幕、分段字幕和异常片段字幕;随后调用 LLM 合成结构化描述并生成 MCQ、二元题和开放题。最后解析为每个任务一个 JSON 文件,使用 tao-vl-reason-v1.0 格式,并写入 results_dir 下的分步 JSONL 和任务 JSON 输出。

  1. 视频理解团队需要从一批原始视频构建带时间信息的字幕和问答训练集。
  2. 数据工程师需要自动标注包含正常与异常样本的混合视频数据集。
  3. 研究人员希望为视频模型生成带步骤化推理轨迹的选择题、二元题或开放题。
  4. 交通监控或仓库监控团队需要使用领域提示词生成更贴合摄像头场景的标注。
  5. 首次运行或修改提示词的用户需要先用 5–10 个视频进行质量试运行。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从视频字幕到描述、问答和最终 JSON 数据集的完整多步骤流程。
  • 支持 Gemini 和 OpenAI 兼容端点,并允许文本步骤使用更小、更便宜的 LLM。
  • 支持通用、交通、仓库和自定义领域提示词。
  • 每个步骤可单独选择,且已处理视频会自动跳过,便于断点续跑。
局限
  • 依赖 Docker、nvidia-container-toolkit、ffmpeg/ffprobe 和外部 VLM 端点。
  • 调用模型会受 API 访问权限、费用和速率限制影响;并行度需要结合 API 限制调整。
  • 输出质量依赖前期字幕质量,提示词或自定义领域通常需要人工检查和迭代。
  • 源材料未提供独立测试套件、性能基准或不同硬件平台的验证结果。

如何安装这个 Skill?

使用集合 README 中给出的 Skills CLI 安装命令:npx skills add nvidia/skills --skill tao-generate-video-reasoning-annotations --yes。该仓库是包含 324 个技能的集合;这里应只安装并使用 tao-generate-video-reasoning-annotations。源材料未说明该技能的独立手工复制路径或额外安装包步骤。

如何使用这个 Skill?

先确认视频路径、视频领域、数据模式和 VLM/LLM 端点。然后在 TAO Toolkit 容器中执行:auto_label generate -e /path/to/spec.yaml results_dir=/results video_reasoning_annotation.data.video_root=/videos video_reasoning_annotation.vlm.gemini.api_key=$GOOGLE_API_KEY video_reasoning_annotation.workflow.mode=auto。首次运行、使用自定义领域或修改提示词时,建议先处理 5–10 个视频,并检查 results_dir/step_1a_caption/captions.jsonl 与 results_dir/step_3_qa/qa_output.jsonl。

这个 Skill 与同类方案有什么区别?

该技能明确支持两类模型端点:默认的 Gemini,以及提供 base_url、model_name 和 api_key 的 OpenAI 兼容端点。步骤 0–1 需要模型查看视频,步骤 2–3 仅处理文本,因此两类步骤可以使用不同成本和能力的模型。

常见问题

必须使用 Gemini 吗?
不必须。可以使用 Gemini,也可以使用 OpenAI 兼容端点;后者需要提供 base_url、model_name 和 api_key。
没有模型端点可以运行吗?
不能直接运行。需要 GOOGLE_API_KEY 或 OpenAI 兼容端点;源材料还提到可通过另一个 TAO 推理服务技能自托管端点。
它会生成哪些文件?
步骤 0–3 生成每个视频一行的 JSONL;步骤 4 为非空任务生成最多 10 个 tao-vl-reason-v1.0 JSON 文件。
如何降低首次运行风险?
先运行 5–10 个视频的试点,检查字幕准确性以及问答的答案和推理逻辑,再扩展到完整数据集。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

数据与分析 ✓ NVIDIA · 官方

TAO 图像指代表达式标注管线

将图像和 KITTI 框标注转换为可定位的指代表达式数据。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

自动化与运维 ✓ NVIDIA · 官方

VSS 视频分析报告

为单个视频片段或事件时间范围生成结构化的视频分析报告。

数据与分析 ✓ NVIDIA · 官方

TAO VLM 二分类差距分析

从 VLM 是非预测中提取误报和漏报样本,支持后续根因分析。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

相关 Skills