数据与分析 ✓ NVIDIA · 官方 action-recognitionvideo-classificationoptical-flowtao-toolkitautomldocker-gpu

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

FollowSkills 评估 · FSRS-2.0
不推荐
46/ 100 五分制 2.3 / 5
信任安全14 / 25 · 2.8/5

技能限定为 Read 和 Bash,并明确数据目录、检查点和输出路径,未见恶意行为、凭据窃取或隐蔽外传;但要求 Docker、GPU、下载解压数据并默认启用 Weights & Biases,未规定用户确认、网络/遥测披露、敏感视频数据处理、权限隔离或回滚,因此扣分。

可靠稳定8 / 20 · 2.0/5

文档覆盖训练、评估、推理、导出、AutoML、检查点和若干错误模式,并提供确定性训练默认值;但未提供可执行测试或失败输出样例,AutoML 依赖外部 tao-run-automl,且“单节点导向”与 schema 中允许 num_nodes>1 存在不一致,异常输入和依赖失败反馈仍不完整,因此按静态上限保守扣分。

适用触发8 / 15 · 2.7/5

触发短语、RGB/光流/联合输入、训练与非训练动作、GPU 和数据要求较清楚;但未明确不适用场景、TAO/容器版本、数据集格式边界或中文使用方式,且依赖 Docker、NVIDIA Container Toolkit 和可能的外部镜像/下载,未说明中国大陆网络可达性,因此扣分。

规范维护7 / 15 · 2.3/5

目录包含 SKILL.md、引用模板、skill_info、schema、评估报告和版本字段,结构化参数及维护者信息较完整;但缺少独立 Instructions、Examples、FAQ、变更日志、明确维护责任/更新路径,license 元数据为 NOASSERTION 而技能声明 Apache-2.0,仓库文档又采用 Apache/CC-BY 双许可证,存在治理与授权澄清不足,因此扣分。

有效结果6 / 15 · 2.0/5

对核心任务给出了数据路径、spec_overrides、检查点选择、训练/评估/推理/导出映射和 AutoML 分流,理论上能减少配置工作;但没有静态可核验的直接可用产出,样例依赖固定 catch/smile 数据和未给出的环境,且基准仅一个任务、发现率为 0%、Codex 正确性为 20%,因此只能给有限分数。

证据核验3 / 10 · 1.5/5

存在固定 revision、结构化 schema、模板、skill_info、evals.json 和一份 benchmark 报告,提供了一定审计线索;但没有可执行测试套件、CI 覆盖、日志或独立复现材料,benchmark 仅一个任务且报告本身无法在静态审查中充分验证,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 默认 wandb.enable=true,运行可能向外部服务发送实验元数据;处理敏感视频前应确认网络、遥测和数据合规策略。
  • 运行前需确认 Docker、NVIDIA Container Toolkit、TAO 镜像、GPU 显存和数据下载在目标环境可用,尤其是中国大陆网络环境。
  • 检查点、label_map、序列长度和目录路径必须与训练一致;文档未提供可执行验证或自动回滚机制。
  • 应澄清 Apache-2.0、CC-BY-4.0 与 NOASSERTION 之间的许可证适用关系。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 NVIDIA TAO Toolkit 进行视频时序动作分类的工作流。它支持 RGB、光流和联合多流输入,并覆盖训练、评估、推理与 ONNX 导出。训练默认使用 AutoML 路由,也可按单次运行关闭 AutoML。运行需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU,适合已有视频数据集与 TAO 运行环境的用户。

读取 TAO 动作识别的打包 schema、模板和技能配置,解析训练阶段的 AutoML 策略;根据动作要求构造训练、验证、评估和推理数据目录;运行 TAO 训练、评估、推理或导出流程;处理标签映射、检查点、预训练权重、恢复训练和 ONNX 输出路径;针对序列长度不匹配或缺少标签映射等常见错误给出处理要求。

  1. 计算机视觉工程师希望用 RGB 视频训练 catch、smile 等时序动作分类模型。
  2. 模型开发者希望使用光流或 RGB+光流联合输入捕捉视频动作。
  3. ML 工程师希望通过 AutoML 选择以 val_loss 最小化为目标的训练配置。
  4. 部署工程师需要从具体训练检查点导出 ONNX 模型。
  5. 评估人员需要对已训练的 TAO 动作识别模型执行评估或视频推理。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖训练、评估、推理和 ONNX 导出完整流程。
  • 支持 RGB、光流和联合多流输入。
  • 包含 AutoML 路由策略、数据目录要求、检查点推断和常见错误说明。
  • 支持 Lightning 管理的单节点多 GPU 训练。
局限
  • 依赖 Docker、nvidia-container-toolkit 和 NVIDIA GPU;每张 GPU 至少需要 16GB 显存的建议配置。
  • 技能只面向动作识别,不负责视频数据采集、标注或归档下载。
  • 数据归档必须先解压为目录,不能直接把 .tar.gz 路径传给动作识别入口。
  • SKILL.md 未提供独立的测试套件、性能基准或跨平台验证结果。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-train-action-recognition --yes

安装后,将技能目录放入目标 Agent 的技能目录;README 未提供该技能专属的手动复制路径。运行环境还需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU。

如何使用这个 Skill?

安装后,可向 Agent 提出:“train action recognition”或“train an RGB + optical flow action model with TAO”。训练、评估和推理时提供已解压的数据目录及 dataset.label_map;训练默认启用 AutoML,也可明确要求“disable AutoML”或设置 automl_policy: off。使用 TAO 样例归档时,先将 train.tar.gz、test.tar.gz 或 test/smile.tar.gz 解压为目录,再启动容器。导出时提供具体训练检查点和 ONNX 输出路径。

常见问题

需要什么硬件?
最低需要 1 张 NVIDIA GPU,推荐 2 张;建议每张 GPU 具备 16GB 以上显存,实际占用取决于序列长度和输入分辨率。
可以不使用 AutoML 吗?
可以。对单次训练设置 automl_policy: off,或明确提出关闭 AutoML;这不会修改模型元数据。
为什么评估或推理无法加载检查点?
评估和推理需要与训练相同的 dataset.label_map;缺少标签映射时,模型会在检查点验证前构建失败。
这个技能是否需要联网?
如果数据以 TAO 样例归档提供,需要下载并解压 train.tar.gz、test.tar.gz 或 test/smile.tar.gz;具体下载命令未在源材料中给出。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

开发与工程 ✓ NVIDIA · 官方

TAO 技能库能力发现

通过打包的清单快速查询 TAO Skill Bank 支持的工作流、模型、平台和 AutoML 能力。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 姿态分类

用 ST-GCN 将姿态关键点序列分类为动作类别。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

相关 Skills