TAO FoundationStereo 立体深度
使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。
技能限定为 Read 和 Bash,数据挂载建议对输入只读,并明确输出目录、容器和用户权限;但会依赖 Docker、NVIDIA Container Toolkit、S3 路径及 Hugging Face 预训练权重,未充分说明网络数据流、敏感数据处理、依赖完整性、用户确认、回滚或失败后的清理机制,因此扣分。
文档对动作路由、数据格式、检查点解析、形状约束、已知量化问题和验证指标提供了较详细说明;但静态审查无法复现关键路径,且存在当前 CLI、容器版本和模板一致性方面的不确定性,错误反馈和异常输入覆盖仍有限,因此按静态上限保守评分。
名称、触发短语、训练/评估/推理/导出/量化场景、数据集选择规则及部分非适用边界较清晰;但未提供中文使用指导,也未说明大陆网络可达性,训练依赖 Hugging Face 权重且部署依赖 NVIDIA 容器环境,环境适配范围有限,因此扣分。
SKILL.md 采用分层引用结构,包含版本、作者、许可证、参数、模板、排障、基准和维护来源线索;但缺少推荐的 Instructions 和 Examples 章节,基准报告指出目录层级、schemas 目录和作者格式问题,未见明确 changelog、维护责任人或更新流程,因此扣分。
技能覆盖从数据标注、数据集选择、配置生成到运行和结果验证的完整主流程,并给出多种 TAO 动作的直接命令和参数;但静态材料没有证明实际产出可直接使用,量化明确存在已知失败,且部分依赖和配置仍需用户自行诊断,因此未超过静态有效性上限并扣分。
存在版本化参考文件、固定配置示例和一次 NVSkills-Eval 报告,报告显示单个任务通过;但测试样本仅一个、无负向任务,未见覆盖关键执行路径的可核验 CI 与测试套件,许多技术断言无法由所给文件独立交叉验证,因此仅给有限分数。
- 训练阶段可能需要从 Hugging Face 获取预训练权重;在中国大陆网络环境中应先确认可达性,并审查下载来源、缓存和完整性。
- 技能允许通过 Bash 执行 Docker 工作流并写入输出目录;运行前应确认数据路径、输出路径、GPU 使用和容器权限,避免误挂载或覆盖现有结果。
- quantize 在文档所列 TAO 镜像版本中已知会因缺少 load_state_dict_from_checkpoint 而失败,不应将其视为已验证可用路径。
- 基准只有一个正向任务,不能代表训练、评估、导出、部署和异常场景的实际成功率。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO Toolkit 中基于 FoundationStereo 的立体深度估计工作流。它处理双目图像对,可使用真实视差标注进行训练和评估,也可执行无标注推理。支持 train、evaluate、inference、export 和 quantize,并通过 TAO Deploy 处理 TensorRT 引擎生成及 TensorRT 评估和推理。运行环境需要 Docker 与 nvidia-container-toolkit。
读取左右图像、可选的 GT 视差和遮挡掩码 annotation 文件;必要时使用 depth_net convert 生成 annotation;根据数据布局配置 FoundationStereo 与对应 dataset_name;通过容器内的统一 TAO depth_net CLI 执行训练、评估、推理、导出或量化;通过 TAO Deploy 工作流生成 TensorRT 引擎并执行 TensorRT 评估或推理;输出检查点、指标、推理结果和部署产物。
- 计算机视觉工程师需要用 Middlebury、KITTI 或 ETH3D 双目数据训练 FoundationStereo 模型。
- 三维重建开发者需要从左右相机图像生成视差图,但没有 GT 视差用于推理。
- 模型评估人员需要根据 epe、bp1、bp2、bp3、d1 或 rmse 检查立体深度质量。
- 边缘部署工程师需要将训练后的模型导出并通过 TAO Deploy 生成 TensorRT 引擎。
- 数据工程师需要把包含左右图像、视差和可选遮挡掩码的数据整理为 TAO annotation 文件。
这个 Skill 有哪些优点和局限?
- 覆盖从数据 annotation、训练和评估到导出、量化及 TensorRT 部署的完整流程。
- 明确区分 2 列无 GT 推理数据与 3 或 4 列带 GT 数据,并列出多种数据集映射。
- 包含 AutoML 训练策略、容器用户权限、缓存目录和常见错误的操作约束。
- 提供 Middlebury、KITTI、ETH3D、FSD、IsaacRealDataset、Crestereo 和 GenericDataset 支持说明。
- 必须使用 Docker 和 nvidia-container-toolkit,且源材料没有给出独立的非容器运行方式。
- 用户需要自行准备左右图像、视差标注或 annotation 文件,并配置 Depth Anything v2 与 EdgeNeXt 预训练路径。
- PyT depth_net 不接受 gen_trt_engine;TensorRT 引擎必须走 TAO Deploy 工作流。
- 源材料没有说明该单独技能的独立测试套件或具体硬件兼容矩阵。
如何安装这个 Skill?
使用仓库 README 中支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-train-foundation-stereo --yes
安装后,技能会在代理下次加载相关技能时可用。源材料未说明单独复制该技能文件夹的步骤。
如何使用这个 Skill?
向代理提出与技能描述匹配的请求,例如“训练 stereo depth”或“使用 FoundationStereo 做 stereo disparity estimation”。处理训练请求前,需要读取 references/skill_info.yaml 并解析 automl_policy;处理 TAO Deploy 的 gen_trt_engine、TensorRT evaluate 或 TensorRT inference 前,需要先读取 references/tao-deploy-foundation-stereo.md。实际运行需要准备数据可访问路径、annotation 文件、规格 YAML、预训练编码器路径以及可写的输出和缓存目录。
这个 Skill 与同类方案有什么区别?
该技能明确将 GenericDataset 作为非规范数据布局的回退选项,并将 TAO Deploy TensorRT 工作流与 PyT depth_net 工作流区分开来。除此之外,源材料没有提供与其他立体深度工具的直接比较。