TAO 姿态分类
用 ST-GCN 将姿态关键点序列分类为动作类别。
文档声明仅使用 Read/Bash,并明确 Docker、GPU、数据路径、检查点和加密键映射;未见恶意、凭据窃取或破坏性默认行为。扣分原因是缺少用户确认、敏感数据处理、依赖版本固定、外部数据传输边界、回滚和结果清理说明。
动作、模板、参数、确定性设置和错误模式较完整,且说明了缺失 schema、标签形状、图布局和检查点问题。扣分原因是静态审查未执行关键路径;文档对 deploy 能力存在表述矛盾,inference 输出声明与 skill_info 输出定义也不完全一致,异常反馈覆盖有限。
触发词、目标场景、输入格式、动作范围和不适用的 deploy/prune/quantize/standalone retrain 能力均有说明。扣分原因是要求 Docker、NVIDIA 容器工具链、GPU,并大量示例依赖 S3;未说明中文交互或中国大陆网络可达性。
包含 front matter、许可证、版本、作者、标签、分动作模板、schema 说明、参数表、错误模式和 benchmark 文档。扣分原因是缺少推荐的 Instructions、Examples、FAQ,作者格式不符合验证器要求,未提供技能级 changelog、明确维护责任和更新路径;仓库许可证元数据仍为 NOASSERTION。
对训练、评估、导出、推理和可选数据转换给出了较具体的参数、数据文件、检查点传递和常见错误处理;benchmark 报告显示有限任务上的 correctness/effectiveness 结果较好。扣分原因是该 benchmark 只覆盖文档规划任务,未验证真实模型工作流、输出文件或结果质量,仍可能需要较多环境和数据准备。
存在 revision 固定的源文件、schema/template 配置、eval 定义和 benchmark 报告,可审计文档规则与有限行为证据。扣分原因是仅一个评估任务、无覆盖训练关键路径的提交测试或 CI 复现,且静态审查未执行任何命令。
- 该评估未执行 Docker、TAO CLI、训练、评估、导出或推理;不要将 benchmark 报告视为真实模型结果验证。
- 使用前应确认容器镜像、TAO 版本、S3 访问权限、数据格式、检查点选择和加密键处理方式。
- 文档存在 deploy 能力表述矛盾,且 inference 输出文件在 skill_info 中未完整声明,应先核对实际 runner 和 schema。
- 涉及人体姿态数据时,需在技能外部补充隐私、访问控制、保留期限和跨境传输审查。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO Toolkit 的姿态分类工作流,使用 ST-GCN 处理骨架序列和姿态关键点数据。它支持数据集转换、训练、评估、导出和推理,并可通过 AutoML 执行训练。已转换为 `.npy` 和 `.pkl` 的数据可直接用于训练、评估或推理。运行环境需要 Docker、NVIDIA Container Toolkit,以及至少一块具备约 8GB 显存的 GPU。
读取 TAO 姿态分类配置、数据集路径、标签映射和模型检查点;仅在输入为 DeepStream BodyPose 原始 JSON 时运行 pose_classification dataset_convert;使用 pose_classification train 训练或恢复模型;使用 evaluate 计算验证结果,使用 export 生成 ONNX 文件,使用 inference 生成推理结果文本;根据配置和已打包的 schema/template 决定是否通过 tao-skill-bank:tao-run-automl 执行 AutoML。训练通常使用 val_loss 作为需要最小化的监控指标。
- 拥有已转换的 `train_data.npy`、`train_label.pkl`、`val_data.npy` 和 `val_label.pkl`,希望训练六类动作分类模型的数据科学家。
- 只有 DeepStream BodyPose JSON 原始输出,需要先转换为 TAO 可用数据格式的计算机视觉工程师。
- 需要用验证集评估已训练姿态分类检查点的模型开发者。
- 需要把指定 `.pth` 检查点导出为 ONNX,供后续模型流程使用的工程师。
- 需要对 `test_data.npy` 和 `test_label.pkl` 执行动作分类推理并保存结果的研究人员。
这个 Skill 有哪些优点和局限?
- 覆盖姿态分类的转换、训练、恢复训练、评估、ONNX 导出和推理流程。
- 针对 `.npy` / `.pkl` 预转换数据给出了明确的跳过转换规则。
- 提供数据路径、标签映射、图布局、检查点和输出文件等关键参数要求。
- 支持在训练阶段按运行请求启用或关闭 AutoML。
- 仅支持单节点工作流;虽然支持多 GPU 配置,但启动由 Lightning 管理。
- 不提供 deploy、prune、quantize 或 standalone retrain 操作。
- 需要 Docker、NVIDIA Container Toolkit 和 NVIDIA GPU;源材料未说明 CPU-only 运行方式。
- AutoML 依赖已打包且可解析的训练 schema 和 spec template,否则必须改用直接训练。
如何安装这个 Skill?
使用仓库 README 中的 skills CLI 安装指定技能:npx skills add nvidia/skills --skill tao-train-pose-classification --yes。安装目标由 CLI 处理;源材料未进一步规定特定客户端的安装目录。运行技能前,还需准备 Docker、NVIDIA Container Toolkit 和符合要求的 NVIDIA GPU。
如何使用这个 Skill?
在已安装该技能的 Agent 中发送明确请求,例如 train pose classification、skeleton action recognition、ST-GCN 或 keypoint sequence classifier。训练时默认使用 automl_policy: on,也可在新启动请求中指定 automl_policy: off。已转换数据应直接提供 train_data.npy、train_label.pkl、val_data.npy 和 val_label.pkl;原始 DeepStream BodyPose JSON 才需要执行 dataset conversion。后续评估、导出和推理应传入准确的 .pth 检查点及对应的数据路径。