TAO NVPanoptix3D 三维全景重建
训练和运行基于 RGB 图像的三维全景分割与占用补全模型。
文档明确列出 Docker、NVIDIA Container Toolkit、数据文件、检查点和结果目录等边界,并声明上传排除 inputs/;但允许 Bash、默认启用 Weights & Biases、涉及数据上传/训练/导出等外部影响,未规定用户确认、敏感数据处理、回滚或完整数据流披露,因此扣分。
关键命令、参数、数据要求和错误模式较具体,且说明了若干已知失败情形;但文档同时称 fsdp 可选又明确不支持 FSDP,模板默认 monitor_name 为 val_loss 而训练策略要求 train_loss,模板还保留 fp16 等不一致项。未执行验证,故限制在静态可支持范围内并扣分。
触发短语、输入数据格式、train/evaluate/export/inference 场景和硬件要求较清楚;但非适用范围、最低可行资源、中文支持及中国大陆网络可达性没有说明,且至少需要高端多 GPU 环境,因此扣分。
SKILL.md 具有元数据、分层章节、参数表、错误模式、版本号、Apache-2.0 许可和 NVIDIA 作者信息;但缺少独立的 Instructions、Examples、FAQ、变更日志、明确维护责任与版本兼容矩阵,且基准报告指出结构和作者格式问题,因此扣分。
文档覆盖从数据准备到训练、评估、推理和 2D ONNX 导出的主要路径,并给出可直接改写的 spec_overrides;基准文件记录了单个正向任务的较高 Codex 正确性和有效性,但样本极少、静态审查无法验证实际产物,且 3D 导出并不产生,故扣分。
存在提交的 benchmark、evals.json、schemas、模板和具体错误说明,提供了一定可审计依据;但只有一个评测任务、无独立第三方复现或覆盖关键执行路径的测试套件,结论仍主要依赖仓库自述,因此扣分。
- 训练策略、模板和架构说明存在 train_loss/val_loss、fp16/fp32 以及 FSDP/ddp 不一致;使用前应以实际入口和已生成 schema 为准。
- 默认启用 W&B,文档未说明数据、日志和代码是否发送到外部服务;处理敏感数据前应显式关闭或确认其数据流。
- 硬件要求为至少 2 张 GPU、每张建议 40GB 以上显存;未证明在低资源环境或中国大陆网络环境中可用。
- 静态审查未执行命令;benchmark 仅包含一个正向任务,不能证明训练、评估、推理和导出产物的实际正确性。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用已知位姿 RGB 图像进行三维场景重建的 TAO NVPanoptix3D 工作流。它支持模型训练、评估、推理和导出,并生成语义、实例及全景三维分割结果,同时执行占用补全。模型基于 VGGT 主干、Mask2Former 风格头部和三维视锥重建。运行需要 Docker、nvidia-container-toolkit,以及至少 2 张 GPU。
读取并应用 TAO Core 生成的动作 schema、训练模板和模型元数据;根据动作构造训练、评估和推理所需的数据路径,包括 frustum_mask.npz、colormap.json 以及 train.json、val.json 和 test.json;在训练阶段默认通过 tao-run-automl 使用 train_loss 进行最小化优化,也支持关闭 AutoML 后直接训练;处理 2D 和 3D 阶段检查点;调用 NVPanoptix3D 的 Python 模块入口执行 train、evaluate、inference 和 export;导出 2D ONNX 模型,并生成三维全景、实例或语义预测结果。
- 需要从 Front3D 或 Matterport 数据训练三维场景全景分割模型的 TAO 用户。
- 希望对已训练的 NVPanoptix3D 检查点执行验证并查看 PRQ、RSQ、RRQ 指标的研究人员。
- 需要对平面 JPG/PNG RGB 图像目录运行语义、实例或全景三维推理的工程师。
- 需要通过 AutoML 以 train_loss 为指标搜索训练配置的模型开发者。
- 需要将训练结果导出为 2D ONNX 组件并用于后续部署准备的用户。
这个 Skill 有哪些优点和局限?
- 覆盖训练、评估、推理和导出四类模型操作。
- 针对数据文件、检查点传递、AutoML 指标和常见错误提供具体规则。
- 支持 Front3D、Matterport 及部分合成数据集配置。
- 支持语义、实例和全景三种推理模式。
- 最低需要 2 张 GPU,建议 4 张;每张 GPU 建议具备 40GB 以上显存。
- 当前训练入口只支持 fp32,不支持 fp16。
- 当前导出入口只生成 2D ONNX,不生成 3D ONNX。
- 推理图像目录必须是包含顶层 JPG/PNG 文件的平面目录。
- 技能正文没有提供价格、托管服务或独立性能基准数据。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-train-nvpanoptix3d --yes
README 未说明该技能的独立源码仓库或单独安装包。运行环境还需要 Docker 和 nvidia-container-toolkit。
如何使用这个 Skill?
安装后,在支持 Agent Skills 的客户端中提出明确任务,例如:"train NVPanoptix3D"、"run panoptic 3D reconstruction" 或 "evaluate this NVPanoptix3D checkpoint"。训练、评估和推理时必须提供对应数据源路径及元数据文件;Matterport 使用 downsample_factor=2,Front3D 和合成数据使用 1。若直接调用工具包入口,文档给出的形式是:
python -m nvidia_tao_pytorch.cv.nvpanoptix3d.entrypoint.nvpanoptix3d <action> -e <spec>
训练默认启用 AutoML;需要普通训练时,将本次运行的 automl_policy 设为 off。