TAO BEVFusion 训练技能
用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。
技能声明仅允许 Read 和 Bash,并明确要求使用固定 TAO 5.5 容器;未见恶意行为、凭据窃取或隐蔽外传。但涉及 Docker、GPU、数据集、检查点和可能的 AutoML/网络依赖,缺少用户确认、最小挂载范围、敏感数据处理、回滚和数据流说明,因此扣分。
文档覆盖容器选择、数据转换、分布式启动、检查点传递和 SIGSEGV 诊断,且给出失败反馈要求;但没有可执行测试套件或 CI 证据,模板默认 1 GPU 与“最低 2 GPU”存在张力,部分运行前提和 AutoML 路由无法静态复现,因此扣分。
目标用户、触发语句、动作范围和 KITTI/BEVFusion 场景较清晰;但非适用边界、输入输出契约和触发排除条件不完整,没有中文使用说明,核心容器来自 nvcr.io,面向中国大陆的可达性未说明,因此扣分。
目录包含 SKILL、引用配置、模板、schema、评估报告和版本字段,技能许可证为 Apache-2.0,维护归属可追溯到 NVIDIA;但缺少推荐的 Instructions/Examples/FAQ,作者格式不规范,无明确 changelog、维护责任人或更新路径,且仓库许可证元数据为 NOASSERTION,因此扣分。
提供了动作命令、数据路径、参数、模板和常见错误处理,理论上能支持转换、训练、评估和推理;但没有静态之外的代表性结果验证,评估仅 1 个计划型任务,Codex 正确性 20%、有效性 48%,仍需较多环境和数据准备,因此扣分。
存在固定修订、schema、模板、skill_info、评估任务和基准报告,支持有限审计;但评估规模为单任务单次尝试,未提供覆盖关键路径的真实 CI/测试套件,静态审查不能确认命令、容器和模板可运行,因此扣分。
- 执行前确认 Docker、NVIDIA Container Toolkit、GPU 数量/显存、nvcr.io 可达性及镜像获取权限。
- 不要把模板默认值视为已验证配置;特别核对 1 GPU 与最低 2 GPU 的冲突、数据集目录、检查点路径和 AutoML schema。
- 将相机图像、LiDAR、标注和检查点视为潜在敏感数据,先确认挂载、上传排除和日志不会泄露数据。
- 基准证据覆盖极少,且报告显示 Codex 正确性和有效性有限;上线前应补充真实 CI、关键动作测试和失败场景测试。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用 NVIDIA TAO Toolkit 进行 BEVFusion 多传感器三维目标检测的用户。它指导代理在鸟瞰视角空间融合激光雷达点云和摄像头图像,并处理数据转换、训练、评估和推理流程。技能要求 Docker、NVIDIA Container Toolkit 和 BEVFusion 专用 TAO 5.5.0 容器。训练支持 AutoML 路由、多 GPU 和多节点配置,但硬件和数据目录要求较高。
读取技能信息、训练 schema 和规格模板,构造各操作所需的数据路径与 spec_overrides;使用 nvcr.io/nvidia/tao/tao-toolkit:5.5.0-pyt 容器运行 bevfusion convert、训练、评估和推理操作;数据转换会生成 KITTI 风格的信息 pickle 文件和 training/velodyne_reduced;训练使用 torchrun,并可处理检查点、AutoML、GPU 和多节点设置。
- 自动驾驶感知开发者需要用 KITTI 风格数据训练激光雷达加摄像头的 BEVFusion 三维检测模型。
- TAO 用户需要先转换数据集,再执行多 GPU BEVFusion 训练。
- 模型工程师需要使用指定训练检查点进行评估或推理。
- 平台工程师需要在 Docker 环境中运行 BEVFusion 的多节点训练流程。
这个 Skill 有哪些优点和局限?
- 覆盖数据转换、训练、评估和推理的完整 BEVFusion 工作流。
- 明确规定了 BEVFusion 5.5 容器、数据目录名和检查点交接方式。
- 支持 AutoML、多 GPU 和多节点训练配置。
- 提供常见错误模式及 SIGSEGV、缺失模态数据等故障排查指引。
- 至少需要 2 张 GPU,推荐每张 GPU 具备 24GB 以上显存并使用 A100。
- 依赖特定 TAO 5.5.0 BEVFusion 容器和 `mmdet3d`,不能直接使用共享 TAO PyTorch 7.0 RC 镜像。
- 要求数据遵循特定 KITTI 目录结构,并且每个操作都必须配置数据源路径。
- 源材料没有提供该单项技能的具体基准数值或实测平台覆盖范围。
如何安装这个 Skill?
安装整个 NVIDIA 技能集合:npx skills add nvidia/skills。也可以按技能名称安装:npx skills add nvidia/skills --skill tao-train-bevfusion --yes。README 未提供只复制该技能目录的独立安装步骤;技能目录应包含 SKILL.md,并在代理下次加载技能时生效。
如何使用这个 Skill?
在已安装技能的代理中提出例如“训练 BEVFusion”或“进行 LiDAR + camera fusion 三维检测推理”。准备 KITTI 风格数据根目录,并先运行 dataset_convert;随后根据需要运行训练、评估或推理。训练默认启用 AutoML,也可在本次运行中指定 automl_policy: off。使用 BEVFusion 5.5 容器,不要使用缺少 mmdet3d 的共享 TAO PyTorch 7.0 RC 镜像。
这个 Skill 与同类方案有什么区别?
与共享 TAO PyTorch 7.0 RC 镜像相比,该技能要求使用 TAO Toolkit 5.5.0 BEVFusion 专用容器,因为共享镜像不包含 mmdet3d。训练阶段还会在 AutoML 可运行时默认路由到 tao-run-automl,而关闭 AutoML 或缺少训练 schema 时才使用直接模型训练。