数据与分析 ✓ NVIDIA · 官方 panoptic-3dscene-reconstructionsemantic-segmentationoccupancy-completiontao-toolkitautomldocker

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

FollowSkills 评估 · FSRS-2.0
不推荐
49/ 100 五分制 2.5 / 5
信任安全14 / 25 · 2.8/5

文档明确列出 Docker、NVIDIA Container Toolkit、数据文件、检查点和结果目录等边界,并声明上传排除 inputs/;但允许 Bash、默认启用 Weights & Biases、涉及数据上传/训练/导出等外部影响,未规定用户确认、敏感数据处理、回滚或完整数据流披露,因此扣分。

可靠稳定8 / 20 · 2.0/5

关键命令、参数、数据要求和错误模式较具体,且说明了若干已知失败情形;但文档同时称 fsdp 可选又明确不支持 FSDP,模板默认 monitor_name 为 val_loss 而训练策略要求 train_loss,模板还保留 fp16 等不一致项。未执行验证,故限制在静态可支持范围内并扣分。

适用触发8 / 15 · 2.7/5

触发短语、输入数据格式、train/evaluate/export/inference 场景和硬件要求较清楚;但非适用范围、最低可行资源、中文支持及中国大陆网络可达性没有说明,且至少需要高端多 GPU 环境,因此扣分。

规范维护9 / 15 · 3.0/5

SKILL.md 具有元数据、分层章节、参数表、错误模式、版本号、Apache-2.0 许可和 NVIDIA 作者信息;但缺少独立的 Instructions、Examples、FAQ、变更日志、明确维护责任与版本兼容矩阵,且基准报告指出结构和作者格式问题,因此扣分。

有效结果6 / 15 · 2.0/5

文档覆盖从数据准备到训练、评估、推理和 2D ONNX 导出的主要路径,并给出可直接改写的 spec_overrides;基准文件记录了单个正向任务的较高 Codex 正确性和有效性,但样本极少、静态审查无法验证实际产物,且 3D 导出并不产生,故扣分。

证据核验4 / 10 · 2.0/5

存在提交的 benchmark、evals.json、schemas、模板和具体错误说明,提供了一定可审计依据;但只有一个评测任务、无独立第三方复现或覆盖关键执行路径的测试套件,结论仍主要依赖仓库自述,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 训练策略、模板和架构说明存在 train_loss/val_loss、fp16/fp32 以及 FSDP/ddp 不一致;使用前应以实际入口和已生成 schema 为准。
  • 默认启用 W&B,文档未说明数据、日志和代码是否发送到外部服务;处理敏感数据前应显式关闭或确认其数据流。
  • 硬件要求为至少 2 张 GPU、每张建议 40GB 以上显存;未证明在低资源环境或中国大陆网络环境中可用。
  • 静态审查未执行命令;benchmark 仅包含一个正向任务,不能证明训练、评估、推理和导出产物的实际正确性。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用已知位姿 RGB 图像进行三维场景重建的 TAO NVPanoptix3D 工作流。它支持模型训练、评估、推理和导出,并生成语义、实例及全景三维分割结果,同时执行占用补全。模型基于 VGGT 主干、Mask2Former 风格头部和三维视锥重建。运行需要 Docker、nvidia-container-toolkit,以及至少 2 张 GPU。

读取并应用 TAO Core 生成的动作 schema、训练模板和模型元数据;根据动作构造训练、评估和推理所需的数据路径,包括 frustum_mask.npz、colormap.json 以及 train.json、val.json 和 test.json;在训练阶段默认通过 tao-run-automl 使用 train_loss 进行最小化优化,也支持关闭 AutoML 后直接训练;处理 2D 和 3D 阶段检查点;调用 NVPanoptix3D 的 Python 模块入口执行 train、evaluate、inference 和 export;导出 2D ONNX 模型,并生成三维全景、实例或语义预测结果。

  1. 需要从 Front3D 或 Matterport 数据训练三维场景全景分割模型的 TAO 用户。
  2. 希望对已训练的 NVPanoptix3D 检查点执行验证并查看 PRQ、RSQ、RRQ 指标的研究人员。
  3. 需要对平面 JPG/PNG RGB 图像目录运行语义、实例或全景三维推理的工程师。
  4. 需要通过 AutoML 以 train_loss 为指标搜索训练配置的模型开发者。
  5. 需要将训练结果导出为 2D ONNX 组件并用于后续部署准备的用户。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖训练、评估、推理和导出四类模型操作。
  • 针对数据文件、检查点传递、AutoML 指标和常见错误提供具体规则。
  • 支持 Front3D、Matterport 及部分合成数据集配置。
  • 支持语义、实例和全景三种推理模式。
局限
  • 最低需要 2 张 GPU,建议 4 张;每张 GPU 建议具备 40GB 以上显存。
  • 当前训练入口只支持 fp32,不支持 fp16。
  • 当前导出入口只生成 2D ONNX,不生成 3D ONNX。
  • 推理图像目录必须是包含顶层 JPG/PNG 文件的平面目录。
  • 技能正文没有提供价格、托管服务或独立性能基准数据。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-train-nvpanoptix3d --yes

README 未说明该技能的独立源码仓库或单独安装包。运行环境还需要 Docker 和 nvidia-container-toolkit。

如何使用这个 Skill?

安装后,在支持 Agent Skills 的客户端中提出明确任务,例如:"train NVPanoptix3D"、"run panoptic 3D reconstruction" 或 "evaluate this NVPanoptix3D checkpoint"。训练、评估和推理时必须提供对应数据源路径及元数据文件;Matterport 使用 downsample_factor=2,Front3D 和合成数据使用 1。若直接调用工具包入口,文档给出的形式是:

python -m nvidia_tao_pytorch.cv.nvpanoptix3d.entrypoint.nvpanoptix3d <action> -e <spec>

训练默认启用 AutoML;需要普通训练时,将本次运行的 automl_policy 设为 off。

常见问题

这个技能适合什么数据?
训练要求的数据类型是 nvpanoptix3d,支持 front3d 和 matterport;正文还列出 synthetic_hospital 和 synthetic_warehouse 作为 dataset.name 选项。
训练是否必须使用 AutoML?
模型层面启用了 AutoML,默认通过 tao-run-automl 使用 train_loss 并以 minimize 方向优化;将 automl_policy 设为 off 可对本次运行使用直接模型训练。
为什么训练时不能使用 fp16?
虽然 schema 宣传了 fp16,但当前训练入口会拒绝该精度并抛出 ValueError;训练和恢复训练应使用 train.precision=fp32。
导出后为什么没有 3D ONNX 文件?
当前导出入口只调用 2D ONNX 导出器并写入 export.onnx_file_2d,因此不应要求 export.onnx_file_3d。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

开发与工程 ✓ NVIDIA · 官方

TAO 技能库能力发现

通过打包的清单快速查询 TAO Skill Bank 支持的工作流、模型、平台和 AutoML 能力。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

相关 Skills