数据与分析 ✓ NVIDIA · 官方 bevfusion3d-object-detectionlidar-camera-fusiontao-toolkitautonomous-drivingdockermulti-gpu-training

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

FollowSkills 评估 · FSRS-2.0
不推荐
49/ 100 五分制 2.5 / 5
信任安全15 / 25 · 3.0/5

技能声明仅允许 Read 和 Bash,并明确要求使用固定 TAO 5.5 容器;未见恶意行为、凭据窃取或隐蔽外传。但涉及 Docker、GPU、数据集、检查点和可能的 AutoML/网络依赖,缺少用户确认、最小挂载范围、敏感数据处理、回滚和数据流说明,因此扣分。

可靠稳定8 / 20 · 2.0/5

文档覆盖容器选择、数据转换、分布式启动、检查点传递和 SIGSEGV 诊断,且给出失败反馈要求;但没有可执行测试套件或 CI 证据,模板默认 1 GPU 与“最低 2 GPU”存在张力,部分运行前提和 AutoML 路由无法静态复现,因此扣分。

适用触发8 / 15 · 2.7/5

目标用户、触发语句、动作范围和 KITTI/BEVFusion 场景较清晰;但非适用边界、输入输出契约和触发排除条件不完整,没有中文使用说明,核心容器来自 nvcr.io,面向中国大陆的可达性未说明,因此扣分。

规范维护8 / 15 · 2.7/5

目录包含 SKILL、引用配置、模板、schema、评估报告和版本字段,技能许可证为 Apache-2.0,维护归属可追溯到 NVIDIA;但缺少推荐的 Instructions/Examples/FAQ,作者格式不规范,无明确 changelog、维护责任人或更新路径,且仓库许可证元数据为 NOASSERTION,因此扣分。

有效结果6 / 15 · 2.0/5

提供了动作命令、数据路径、参数、模板和常见错误处理,理论上能支持转换、训练、评估和推理;但没有静态之外的代表性结果验证,评估仅 1 个计划型任务,Codex 正确性 20%、有效性 48%,仍需较多环境和数据准备,因此扣分。

证据核验4 / 10 · 2.0/5

存在固定修订、schema、模板、skill_info、评估任务和基准报告,支持有限审计;但评估规模为单任务单次尝试,未提供覆盖关键路径的真实 CI/测试套件,静态审查不能确认命令、容器和模板可运行,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前确认 Docker、NVIDIA Container Toolkit、GPU 数量/显存、nvcr.io 可达性及镜像获取权限。
  • 不要把模板默认值视为已验证配置;特别核对 1 GPU 与最低 2 GPU 的冲突、数据集目录、检查点路径和 AutoML schema。
  • 将相机图像、LiDAR、标注和检查点视为潜在敏感数据,先确认挂载、上传排除和日志不会泄露数据。
  • 基准证据覆盖极少,且报告显示 Codex 正确性和有效性有限;上线前应补充真实 CI、关键动作测试和失败场景测试。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 NVIDIA TAO Toolkit 进行 BEVFusion 多传感器三维目标检测的用户。它指导代理在鸟瞰视角空间融合激光雷达点云和摄像头图像,并处理数据转换、训练、评估和推理流程。技能要求 Docker、NVIDIA Container Toolkit 和 BEVFusion 专用 TAO 5.5.0 容器。训练支持 AutoML 路由、多 GPU 和多节点配置,但硬件和数据目录要求较高。

读取技能信息、训练 schema 和规格模板,构造各操作所需的数据路径与 spec_overrides;使用 nvcr.io/nvidia/tao/tao-toolkit:5.5.0-pyt 容器运行 bevfusion convert、训练、评估和推理操作;数据转换会生成 KITTI 风格的信息 pickle 文件和 training/velodyne_reduced;训练使用 torchrun,并可处理检查点、AutoML、GPU 和多节点设置。

  1. 自动驾驶感知开发者需要用 KITTI 风格数据训练激光雷达加摄像头的 BEVFusion 三维检测模型。
  2. TAO 用户需要先转换数据集,再执行多 GPU BEVFusion 训练。
  3. 模型工程师需要使用指定训练检查点进行评估或推理。
  4. 平台工程师需要在 Docker 环境中运行 BEVFusion 的多节点训练流程。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖数据转换、训练、评估和推理的完整 BEVFusion 工作流。
  • 明确规定了 BEVFusion 5.5 容器、数据目录名和检查点交接方式。
  • 支持 AutoML、多 GPU 和多节点训练配置。
  • 提供常见错误模式及 SIGSEGV、缺失模态数据等故障排查指引。
局限
  • 至少需要 2 张 GPU,推荐每张 GPU 具备 24GB 以上显存并使用 A100。
  • 依赖特定 TAO 5.5.0 BEVFusion 容器和 `mmdet3d`,不能直接使用共享 TAO PyTorch 7.0 RC 镜像。
  • 要求数据遵循特定 KITTI 目录结构,并且每个操作都必须配置数据源路径。
  • 源材料没有提供该单项技能的具体基准数值或实测平台覆盖范围。

如何安装这个 Skill?

安装整个 NVIDIA 技能集合:npx skills add nvidia/skills。也可以按技能名称安装:npx skills add nvidia/skills --skill tao-train-bevfusion --yes。README 未提供只复制该技能目录的独立安装步骤;技能目录应包含 SKILL.md,并在代理下次加载技能时生效。

如何使用这个 Skill?

在已安装技能的代理中提出例如“训练 BEVFusion”或“进行 LiDAR + camera fusion 三维检测推理”。准备 KITTI 风格数据根目录,并先运行 dataset_convert;随后根据需要运行训练、评估或推理。训练默认启用 AutoML,也可在本次运行中指定 automl_policy: off。使用 BEVFusion 5.5 容器,不要使用缺少 mmdet3d 的共享 TAO PyTorch 7.0 RC 镜像。

这个 Skill 与同类方案有什么区别?

与共享 TAO PyTorch 7.0 RC 镜像相比,该技能要求使用 TAO Toolkit 5.5.0 BEVFusion 专用容器,因为共享镜像不包含 mmdet3d。训练阶段还会在 AutoML 可运行时默认路由到 tao-run-automl,而关闭 AutoML 或缺少训练 schema 时才使用直接模型训练。

常见问题

是否需要 NVIDIA GPU?
需要。技能给出的最低要求是 2 张 GPU,推荐 4 张 GPU、每张 24GB 以上显存,并推荐 A100。
可以使用 TAO PyTorch 7.0 RC 镜像吗?
不建议也不能按该技能直接使用。该镜像缺少 `mmdet3d`;应使用 `nvcr.io/nvidia/tao/tao-toolkit:5.5.0-pyt`。
训练前必须做什么?
必须先运行 `dataset_convert`,以生成训练和验证信息 pickle 文件以及 `training/velodyne_reduced`。
AutoML 是否可以关闭?
可以。明确指定 `automl_policy: off`,或使用“关闭 AutoML”“disable AutoML”“no HPO”等请求时,仅对本次运行关闭。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

自动化与运维 ✓ NVIDIA · 官方

TAO 推理微服务部署技能

在多种计算平台上启动、调用并停止 TAO 推理微服务。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

自动化与运维 ✓ NVIDIA · 官方

TAO SLURM 集群运行

通过 SSH、SLURM 和 Pyxis/Enroot 在远程 GPU 集群上运行 TAO 作业。

相关 Skills