数据与分析 ✓ NVIDIA · 官方 stereo-depthdisparity-estimation3d-reconstructionfoundation-stereotao-toolkitdockertensorrt

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全16 / 25 · 3.2/5

技能限定为 Read 和 Bash,数据挂载建议对输入只读,并明确输出目录、容器和用户权限;但会依赖 Docker、NVIDIA Container Toolkit、S3 路径及 Hugging Face 预训练权重,未充分说明网络数据流、敏感数据处理、依赖完整性、用户确认、回滚或失败后的清理机制,因此扣分。

可靠稳定8 / 20 · 2.0/5

文档对动作路由、数据格式、检查点解析、形状约束、已知量化问题和验证指标提供了较详细说明;但静态审查无法复现关键路径,且存在当前 CLI、容器版本和模板一致性方面的不确定性,错误反馈和异常输入覆盖仍有限,因此按静态上限保守评分。

适用触发10 / 15 · 3.3/5

名称、触发短语、训练/评估/推理/导出/量化场景、数据集选择规则及部分非适用边界较清晰;但未提供中文使用指导,也未说明大陆网络可达性,训练依赖 Hugging Face 权重且部署依赖 NVIDIA 容器环境,环境适配范围有限,因此扣分。

规范维护9 / 15 · 3.0/5

SKILL.md 采用分层引用结构,包含版本、作者、许可证、参数、模板、排障、基准和维护来源线索;但缺少推荐的 Instructions 和 Examples 章节,基准报告指出目录层级、schemas 目录和作者格式问题,未见明确 changelog、维护责任人或更新流程,因此扣分。

有效结果6 / 15 · 2.0/5

技能覆盖从数据标注、数据集选择、配置生成到运行和结果验证的完整主流程,并给出多种 TAO 动作的直接命令和参数;但静态材料没有证明实际产出可直接使用,量化明确存在已知失败,且部分依赖和配置仍需用户自行诊断,因此未超过静态有效性上限并扣分。

证据核验3 / 10 · 1.5/5

存在版本化参考文件、固定配置示例和一次 NVSkills-Eval 报告,报告显示单个任务通过;但测试样本仅一个、无负向任务,未见覆盖关键执行路径的可核验 CI 与测试套件,许多技术断言无法由所给文件独立交叉验证,因此仅给有限分数。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 训练阶段可能需要从 Hugging Face 获取预训练权重;在中国大陆网络环境中应先确认可达性,并审查下载来源、缓存和完整性。
  • 技能允许通过 Bash 执行 Docker 工作流并写入输出目录;运行前应确认数据路径、输出路径、GPU 使用和容器权限,避免误挂载或覆盖现有结果。
  • quantize 在文档所列 TAO 镜像版本中已知会因缺少 load_state_dict_from_checkpoint 而失败,不应将其视为已验证可用路径。
  • 基准只有一个正向任务,不能代表训练、评估、导出、部署和异常场景的实际成功率。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA TAO Toolkit 中基于 FoundationStereo 的立体深度估计工作流。它处理双目图像对,可使用真实视差标注进行训练和评估,也可执行无标注推理。支持 train、evaluate、inference、export 和 quantize,并通过 TAO Deploy 处理 TensorRT 引擎生成及 TensorRT 评估和推理。运行环境需要 Docker 与 nvidia-container-toolkit。

读取左右图像、可选的 GT 视差和遮挡掩码 annotation 文件;必要时使用 depth_net convert 生成 annotation;根据数据布局配置 FoundationStereo 与对应 dataset_name;通过容器内的统一 TAO depth_net CLI 执行训练、评估、推理、导出或量化;通过 TAO Deploy 工作流生成 TensorRT 引擎并执行 TensorRT 评估或推理;输出检查点、指标、推理结果和部署产物。

  1. 计算机视觉工程师需要用 Middlebury、KITTI 或 ETH3D 双目数据训练 FoundationStereo 模型。
  2. 三维重建开发者需要从左右相机图像生成视差图,但没有 GT 视差用于推理。
  3. 模型评估人员需要根据 epe、bp1、bp2、bp3、d1 或 rmse 检查立体深度质量。
  4. 边缘部署工程师需要将训练后的模型导出并通过 TAO Deploy 生成 TensorRT 引擎。
  5. 数据工程师需要把包含左右图像、视差和可选遮挡掩码的数据整理为 TAO annotation 文件。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从数据 annotation、训练和评估到导出、量化及 TensorRT 部署的完整流程。
  • 明确区分 2 列无 GT 推理数据与 3 或 4 列带 GT 数据,并列出多种数据集映射。
  • 包含 AutoML 训练策略、容器用户权限、缓存目录和常见错误的操作约束。
  • 提供 Middlebury、KITTI、ETH3D、FSD、IsaacRealDataset、Crestereo 和 GenericDataset 支持说明。
局限
  • 必须使用 Docker 和 nvidia-container-toolkit,且源材料没有给出独立的非容器运行方式。
  • 用户需要自行准备左右图像、视差标注或 annotation 文件,并配置 Depth Anything v2 与 EdgeNeXt 预训练路径。
  • PyT depth_net 不接受 gen_trt_engine;TensorRT 引擎必须走 TAO Deploy 工作流。
  • 源材料没有说明该单独技能的独立测试套件或具体硬件兼容矩阵。

如何安装这个 Skill?

使用仓库 README 中支持的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-train-foundation-stereo --yes

安装后,技能会在代理下次加载相关技能时可用。源材料未说明单独复制该技能文件夹的步骤。

如何使用这个 Skill?

向代理提出与技能描述匹配的请求,例如“训练 stereo depth”或“使用 FoundationStereo 做 stereo disparity estimation”。处理训练请求前,需要读取 references/skill_info.yaml 并解析 automl_policy;处理 TAO Deploy 的 gen_trt_engine、TensorRT evaluate 或 TensorRT inference 前,需要先读取 references/tao-deploy-foundation-stereo.md。实际运行需要准备数据可访问路径、annotation 文件、规格 YAML、预训练编码器路径以及可写的输出和缓存目录。

这个 Skill 与同类方案有什么区别?

该技能明确将 GenericDataset 作为非规范数据布局的回退选项,并将 TAO Deploy TensorRT 工作流与 PyT depth_net 工作流区分开来。除此之外,源材料没有提供与其他立体深度工具的直接比较。

常见问题

是否可以在没有 GT 视差的情况下推理?
可以。立体推理支持每行包含左右图像路径的 2 列 annotation;这种情况下 dataset_name 必须使用 GenericDataset。
训练时 AutoML 是默认开启的吗?
是。技能要求默认使用 automl_policy: on;只有用户明确关闭 AutoML,或所需 schema/template 缺失时,才使用直接模型训练。
为什么不能直接让 depth_net 生成 TensorRT 引擎?
当前 TAO 镜像中的 PyT depth_net entrypoint 不接受 gen_trt_engine。生成引擎以及 TensorRT evaluate 和 inference 必须使用 TAO Deploy 流程。
运行失败时应检查什么?
应先检查容器退出码、status.json 中的 kpi,以及训练 loss 是否为 NaN;评估应查看 epe、bp1、bp2、bp3、d1 和 rmse,并按需参考技能提供的故障排查文档。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO 度量学习识别

为细粒度视觉识别训练可用于检索匹配的图像嵌入模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

开发与工程 ✓ NVIDIA · 官方

TAO OCRNet 场景文字识别技能

用 NVIDIA TAO 训练并部署场景文字识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

数据与分析 ✓ NVIDIA · 官方

TAO NVDINOv2 视觉表征训练

用无标签自蒸馏训练可复用的视觉特征骨干。

相关 Skills