开发与工程 ✓ NVIDIA · 官方 3d-object-detectionmulti-cameratemporal-trackingtao-toolkitmodel-trainingmodel-quantizationdockernvidia-gpu

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

FollowSkills 评估 · FSRS-2.0
不推荐
54/ 100 五分制 2.7 / 5
信任安全17 / 25 · 3.4/5

文档声明仅允许 Read 和 Bash,并明确容器、数据路径、检查点和 AutoML 路由;未见恶意行为、凭据窃取或隐蔽外传。但 Bash 权限较宽,缺少逐次用户确认、最小权限边界、敏感数据处理说明、回滚方案和外部副作用控制;W&B 默认启用且可能产生外部数据流,因此扣分。

可靠稳定8 / 20 · 2.0/5

SKILL.md、skill_info.yaml、模板和故障模式对转换、训练、评估、导出、推理及量化路径描述较完整,也给出文件检查和失败提示。静态材料未提供覆盖关键路径的可执行测试或 CI 复现;文档还记录旧镜像量化失败和导出兼容性限制,因此按静态上限和不确定性扣分。

适用触发10 / 15 · 3.3/5

触发短语、目标用户场景、动作范围、输入格式、硬件要求和不适用条件较清楚,覆盖多相机时序 3D 检测与跟踪。未声明中文交互支持,且依赖 Docker、NVIDIA Container Toolkit、GPU、特定 TAO 镜像及可能的 S3 数据源;对中国大陆网络和镜像可达性没有说明,因此扣分。

规范维护9 / 15 · 3.0/5

目录包含主说明、引用文档、模板、元数据、评测报告和版本号,且许可证字段为 Apache-2.0,维护者和仓库同步背景较明确。缺少推荐的 Instructions/Examples 章节,作者格式不完整,版本变更记录、维护责任、依赖版本和统一安装/故障排查入口不充分;评测报告还记录目录层级和额外 schemas 结构问题。

有效结果6 / 15 · 2.0/5

技能覆盖 dataset_convert、train、evaluate、export、inference、quantize,并提供数据源映射、参数模板、检查点推断、AutoML 策略和常见故障处理,能够显著减少手工配置。静态评估无法确认实际模型结果或端到端产物;评测只有一个任务,且未证明各动作输出均可直接使用,因此扣分。

证据核验4 / 10 · 2.0/5

存在结构化 skill_info.yaml、可审计模板、参数映射、评测报告和固定版本信息,支持有限追溯。评测样本仅一个,缺少独立复现记录、关键动作测试套件、CI 覆盖和多来源交叉验证;报告中的 PASS 不能替代本次静态审查中的执行验证,因此未给满分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应确认 Bash 操作、数据挂载、W&B 外部通信和 AutoML 路由,并验证用户提供的镜像、GPU、数据源和检查点权限。
  • 量化和导出存在已记录的镜像、摄像头数量、anchor 数量及检查点兼容性限制;应先做小规模验证并保留可恢复的输出。
  • 未提供中文支持或中国大陆网络可达性说明,TAO 容器和远程数据源可能无法直接访问。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA TAO Toolkit 的 Sparse4D 模型,用于多摄像头时序3D目标检测与跟踪。它涵盖数据转换、训练、评估、导出、量化和推理,并处理实例库、时序推理及检查点衔接。训练阶段默认启用 AutoML,但可按单次运行关闭。运行需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU;官方建议每张GPU具备40GB以上显存。

读取模型层配置、打包的JSON schema、规格模板和参考文档;要求先执行 dataset_convert,将 AICity 数据转换为 OVPKL 标注并生成 anchor_init.npy;为 train、evaluate、export、inference 和 quantize 构造必需的 spec_overrides 与数据路径;训练请求在条件满足时路由至 tao-skill-bank:tao-run-automl;调用相应容器和命令执行模型操作,并处理检查点、H5深度路径、量化失败和时序显存不足等问题。

  1. 需要用多摄像头数据训练 Sparse4D 3D检测模型的 TAO 用户。
  2. 需要在验证集或测试集上评估检测或跟踪指标的视觉团队。
  3. 需要导出模型用于部署,或从训练检查点执行推理的工程师。
  4. 需要使用 TorchAO 对 Sparse4D 检查点进行量化的部署团队。
  5. 需要通过 AutoML 搜索训练参数,或进行关闭HPO的普通训练实验的研究人员。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 Sparse4D 的完整训练到推理流程。
  • 内置 AutoML 路由、数据依赖映射和检查点解析规则。
  • 包含 AICity 转 OVPKL、H5深度路径和时序显存问题的故障处理说明。
  • 明确记录多GPU、多节点和关键模型参数。
局限
  • 需要先完成 dataset_convert,数据必须符合 sparse4d/ovpkl 工作流。
  • 硬件需求高:最低2张GPU,建议8张,每张40GB以上显存。
  • 技能正文引用了多个 references、schemas 和模型容器,但提供材料未展示这些文件的完整内容。
  • 提供材料没有给出独立测试套件、具体平台验证结果或量化成功率。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-train-sparse4d --yes

README 未说明该命令为每个平台设置的确切本地目录;CLI 会处理安装目标。

如何使用这个 Skill?

安装后,向代理提出例如“train Sparse4D”“multi-camera 3D detection”“temporal 3D tracker”或“sparse query 3D perception”。进行训练前准备兼容的数据转换结果,并先运行 dataset_convert 生成 OVPKL 标注和 anchor_init.npy。训练时可明确指定 automl_policy: onautoml_policy: off;其他操作包括 evaluate、export、inference 和 quantize。

常见问题

是否必须使用 AutoML?
不是。训练默认使用 AutoML,但可将本次运行的 `automl_policy` 设置为 `off`;非训练操作不受该覆盖项影响。
是否可以跳过 dataset_convert?
不建议也不支持该流程。技能要求先执行 dataset_convert,以生成标注pickle文件和 anchor_init.npy。
运行需要什么硬件和软件?
需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU。最低要求为2张GPU,建议8张,并要求每张GPU具备40GB以上显存。
量化失败时怎么办?
技能要求保留 quantize 操作,报告容器或镜像失败,并显示精确检查点路径;正文指出旧版7.0.0-rc PyT镜像可能存在量化入口或ONNX依赖问题。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

自动化与运维 ✓ NVIDIA · 官方

TAO NVIDIA GPU 主机配置

为 TAO 的 Docker 与 Kubernetes GPU 主机检查并配置 NVIDIA 驱动、CUDA 和容器运行时。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

开发与工程 ✓ NVIDIA · 官方

TAO OCRNet 场景文字识别技能

用 NVIDIA TAO 训练并部署场景文字识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

自动化与运维 ✓ NVIDIA · 官方

NVIDIA GPU Docker 运行规范

为 NVIDIA GPU 容器工作负载提供可复用的 Docker 运行、认证、挂载与故障排查规范。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

自动化与运维 ✓ NVIDIA · 官方

Holoscan NGC 容器安装助手

通过 NGC Docker 容器安装、验证并启动 NVIDIA Holoscan SDK。

开发与工程 ✓ NVIDIA · 官方

Holoscan SDK 源码构建

在 Docker 容器中从源码构建 Holoscan SDK,并生成可供 CMake 使用的本地安装目录。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

相关 Skills