TAO 视频动作识别训练
用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。
技能限定为 Read 和 Bash,并明确数据目录、检查点和输出路径,未见恶意行为、凭据窃取或隐蔽外传;但要求 Docker、GPU、下载解压数据并默认启用 Weights & Biases,未规定用户确认、网络/遥测披露、敏感视频数据处理、权限隔离或回滚,因此扣分。
文档覆盖训练、评估、推理、导出、AutoML、检查点和若干错误模式,并提供确定性训练默认值;但未提供可执行测试或失败输出样例,AutoML 依赖外部 tao-run-automl,且“单节点导向”与 schema 中允许 num_nodes>1 存在不一致,异常输入和依赖失败反馈仍不完整,因此按静态上限保守扣分。
触发短语、RGB/光流/联合输入、训练与非训练动作、GPU 和数据要求较清楚;但未明确不适用场景、TAO/容器版本、数据集格式边界或中文使用方式,且依赖 Docker、NVIDIA Container Toolkit 和可能的外部镜像/下载,未说明中国大陆网络可达性,因此扣分。
目录包含 SKILL.md、引用模板、skill_info、schema、评估报告和版本字段,结构化参数及维护者信息较完整;但缺少独立 Instructions、Examples、FAQ、变更日志、明确维护责任/更新路径,license 元数据为 NOASSERTION 而技能声明 Apache-2.0,仓库文档又采用 Apache/CC-BY 双许可证,存在治理与授权澄清不足,因此扣分。
对核心任务给出了数据路径、spec_overrides、检查点选择、训练/评估/推理/导出映射和 AutoML 分流,理论上能减少配置工作;但没有静态可核验的直接可用产出,样例依赖固定 catch/smile 数据和未给出的环境,且基准仅一个任务、发现率为 0%、Codex 正确性为 20%,因此只能给有限分数。
存在固定 revision、结构化 schema、模板、skill_info、evals.json 和一份 benchmark 报告,提供了一定审计线索;但没有可执行测试套件、CI 覆盖、日志或独立复现材料,benchmark 仅一个任务且报告本身无法在静态审查中充分验证,因此扣分。
- 默认 wandb.enable=true,运行可能向外部服务发送实验元数据;处理敏感视频前应确认网络、遥测和数据合规策略。
- 运行前需确认 Docker、NVIDIA Container Toolkit、TAO 镜像、GPU 显存和数据下载在目标环境可用,尤其是中国大陆网络环境。
- 检查点、label_map、序列长度和目录路径必须与训练一致;文档未提供可执行验证或自动回滚机制。
- 应澄清 Apache-2.0、CC-BY-4.0 与 NOASSERTION 之间的许可证适用关系。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用 NVIDIA TAO Toolkit 进行视频时序动作分类的工作流。它支持 RGB、光流和联合多流输入,并覆盖训练、评估、推理与 ONNX 导出。训练默认使用 AutoML 路由,也可按单次运行关闭 AutoML。运行需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU,适合已有视频数据集与 TAO 运行环境的用户。
读取 TAO 动作识别的打包 schema、模板和技能配置,解析训练阶段的 AutoML 策略;根据动作要求构造训练、验证、评估和推理数据目录;运行 TAO 训练、评估、推理或导出流程;处理标签映射、检查点、预训练权重、恢复训练和 ONNX 输出路径;针对序列长度不匹配或缺少标签映射等常见错误给出处理要求。
- 计算机视觉工程师希望用 RGB 视频训练 catch、smile 等时序动作分类模型。
- 模型开发者希望使用光流或 RGB+光流联合输入捕捉视频动作。
- ML 工程师希望通过 AutoML 选择以 val_loss 最小化为目标的训练配置。
- 部署工程师需要从具体训练检查点导出 ONNX 模型。
- 评估人员需要对已训练的 TAO 动作识别模型执行评估或视频推理。
这个 Skill 有哪些优点和局限?
- 覆盖训练、评估、推理和 ONNX 导出完整流程。
- 支持 RGB、光流和联合多流输入。
- 包含 AutoML 路由策略、数据目录要求、检查点推断和常见错误说明。
- 支持 Lightning 管理的单节点多 GPU 训练。
- 依赖 Docker、nvidia-container-toolkit 和 NVIDIA GPU;每张 GPU 至少需要 16GB 显存的建议配置。
- 技能只面向动作识别,不负责视频数据采集、标注或归档下载。
- 数据归档必须先解压为目录,不能直接把 .tar.gz 路径传给动作识别入口。
- SKILL.md 未提供独立的测试套件、性能基准或跨平台验证结果。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-train-action-recognition --yes
安装后,将技能目录放入目标 Agent 的技能目录;README 未提供该技能专属的手动复制路径。运行环境还需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU。
如何使用这个 Skill?
安装后,可向 Agent 提出:“train action recognition”或“train an RGB + optical flow action model with TAO”。训练、评估和推理时提供已解压的数据目录及 dataset.label_map;训练默认启用 AutoML,也可明确要求“disable AutoML”或设置 automl_policy: off。使用 TAO 样例归档时,先将 train.tar.gz、test.tar.gz 或 test/smile.tar.gz 解压为目录,再启动容器。导出时提供具体训练检查点和 ONNX 输出路径。