TAO FastFoundationStereo 实时立体深度
指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。
技能声明仅使用 Read、Bash,并要求 Docker、NVIDIA Container Toolkit、只读数据挂载和用户提供检查点;文档披露数据、输出和检查点路径,并说明训练、评估、导出和部署链路。扣分原因是允许 Bash 和 Docker 产生显著外部计算、文件写入及 GPU 资源影响,但没有明确的逐步用户确认、权限隔离、敏感数据处理、回滚方案或依赖完整性验证。许可证和 NVIDIA 来源可追溯,但不能替代安全控制。
文档对模型宽度、数据格式、检查点解析、常见错误、KPI 差异和静默失败提供了较具体说明,且包含 AutoML 与直接训练分流。扣分原因是静态审查无法复现关键路径;依赖的容器、TAO Core、tao-skill-bank、TensorRT 和引用模板未在本证据中完整提供,且部分失败仍需用户自行诊断。按静态校准不超过10分。
触发短语、适用动作、原始 bp2 部署与微调边界、数据集类型、推理输入格式和不适用的训练检查点情形均有说明。扣分原因是需要 NVIDIA GPU、Docker、NVIDIA Container Toolkit、商业 bp2 检查点及可访问的数据路径;没有明确中文交互支持或中国大陆网络可达性说明,且示例使用 S3/容器生态,环境适配证据有限。
技能元数据包含名称、版本0.1.0、作者、许可证、兼容性和标签;文档按前置条件、步骤、参数、错误模式和部署引用分层组织。扣分原因是基准报告记录缺少 Instructions 和 Examples 推荐章节、作者格式不规范及目录层级问题;没有明确变更日志、维护负责人、支持周期或更新路径,且若干核心内容依赖未随证据完整展示的引用文件。
技能覆盖训练、评估、推理、导出、TensorRT 引擎生成和部署,并给出可直接改写的 YAML/Python 参数块、检查指标和七步流程,核心任务在文档层面可行。扣分原因是未执行验证,输出质量和约10倍延迟优势没有在本次静态审查中独立确认;用户仍需准备容器、GPU、数据、bp2 检查点并处理多个路径与配置细节。按静态校准最高7分。
证据包含固定版本元数据、提交修订、参数模板、错误模式、评估任务和一份 NVSkills-Eval 报告;报告披露了安全、正确性和可发现性结果以及静态检查发现。扣分原因是测试集仅含一个任务、无负向任务,报告结果不能替代本次独立复现;没有多来源交叉验证,关键模型行为和性能主张主要依赖文档陈述。按静态校准最高5分。
- 运行前应明确确认 Docker、GPU、挂载路径和输出目录的写入范围;该技能没有提供自动回滚或清理策略。
- 必须提供并验证与 bp2 架构匹配的 model_best_bp2_serialize.pth;缺少宽度覆盖、max_disparity=192 或 gwc_feature_normalize=true 可能导致形状错误或错误视差。
- 动态部署输入若不满足步长约束可能在 status.json 显示成功但不生成结果;应检查实际输出文件而非只看退出状态。
- 文档未证明中文体验或中国大陆网络可达性,S3、容器镜像和相关 TAO 依赖可能造成部署可用性风险。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO Toolkit 中的 FastFoundationStereo(FFS)模型,用于双目深度估计。它覆盖训练、评估、导出、TensorRT 引擎生成和 PyT/TRT 推理,并通过统一的 TAO depth_net CLI 执行。FFS 是 FoundationStereo 的 bp2 商业蒸馏版本,采用剪枝后的层宽和序列化前向路径,目标是比完整 FoundationStereo 低约 10 倍延迟。运行需要 Docker、nvidia-container-toolkit、可从容器访问的数据,以及匹配的 bp2 商业检查点;未提供该检查点时可以验证流程,但指标不代表 bp2 模型性能。
读取双目图像对、可选的 GT 视差和遮挡掩码,并使用每行 2 至 4 列的标注文件。为 TAO depth_net 配置 FastFoundationStereo、数据集类型、15 个 bp2 模型宽度覆盖项及训练或部署参数。按需执行 train、evaluate、inference、export 和 gen_trt_engine,生成检查点、评估指标、视差样本、静态 FP32 ONNX 或 FP16 TensorRT 引擎。它还指导检查容器退出码、status.json 中的 KPI、训练损失及 PyT 与部署结果之间的差异。
- 需要在用户双目数据上微调 FFS,并完成从训练到 TensorRT 部署的视觉工程师。
- 已有 model_best_bp2_serialize.pth、希望直接评估或部署商业 bp2 模型的团队。
- 需要使用 Middlebury、KITTI、ETH3D、FSD、IsaacReal 或 Crestereo 数据集训练和评估的研究人员。
- 需要对无 GT 双目图像执行实时视差推理并检查输出样本的开发者。
- 需要将 FFS 导出为静态 ONNX 并生成 FP16 TensorRT 引擎的部署工程师。
这个 Skill 有哪些优点和局限?
- 覆盖训练、评估、导出、TensorRT 部署和 PyT/TRT 推理的完整工作流。
- 针对 FFS 的 bp2 固定模型宽度、max_disparity 和部署配置提供了明确约束。
- 支持多种注册数据集以及不符合标准布局的 GenericDataset。
- 包含错误模式、KPI 验证和父模型检查点传递方面的操作指导。
- 必须使用 Docker 和 nvidia-container-toolkit,并正确挂载数据、输出目录和检查点。
- 原始部署和微调流程依赖 pre-trained bp2 商业检查点;源材料未提供该检查点。
- 没有该检查点时只能验证流程,所得指标不代表 bp2 模型性能。
- 源材料没有列出具体 GPU 型号、完整硬件兼容矩阵或独立测试套件。
如何安装这个 Skill?
使用仓库 README 提供的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-train-fast-foundation-stereo --yes
也可以指定 Codex:
npx skills add nvidia/skills --skill tao-train-fast-foundation-stereo --agent codex --yes
运行技能还需要 Docker 和 nvidia-container-toolkit。README 未说明该技能的独立软件包版本或单独安装命令。
如何使用这个 Skill?
向 Agent 提出与“train fast stereo”“real-time stereo disparity”“FastFoundationStereo”或“distilled stereo depth”相关的请求。准备可从容器访问的左右图像、可选 GT 视差和标注文件,并提供 bp2 检查点路径。对于训练,默认使用 AutoML;如需关闭,可明确说“disable AutoML”或设置 automl_policy: off。对于部署动作,先读取技能引用的 TAO Deploy 说明,再按 train、evaluate、inference、export、gen_trt_engine、inference、evaluate 的流程执行;无训练时可直接从 bp2 检查点开始。
这个 Skill 与同类方案有什么区别?
相较于完整 FoundationStereo,FFS 是其 bp2 商业蒸馏变体,使用剪枝后的每层宽度和序列化前向路径,目标是约 10 倍更低的延迟;其入口、动作、数据集类和部署链保持一致。