数据与分析 ✓ NVIDIA · 官方 stereo-depthdisparity-estimationfastfoundationstereotao-toolkittensorRTdocker

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

FollowSkills 评估 · FSRS-2.0
不推荐
55/ 100 五分制 2.8 / 5
信任安全16 / 25 · 3.2/5

技能声明仅使用 Read、Bash,并要求 Docker、NVIDIA Container Toolkit、只读数据挂载和用户提供检查点;文档披露数据、输出和检查点路径,并说明训练、评估、导出和部署链路。扣分原因是允许 Bash 和 Docker 产生显著外部计算、文件写入及 GPU 资源影响,但没有明确的逐步用户确认、权限隔离、敏感数据处理、回滚方案或依赖完整性验证。许可证和 NVIDIA 来源可追溯,但不能替代安全控制。

可靠稳定8 / 20 · 2.0/5

文档对模型宽度、数据格式、检查点解析、常见错误、KPI 差异和静默失败提供了较具体说明,且包含 AutoML 与直接训练分流。扣分原因是静态审查无法复现关键路径;依赖的容器、TAO Core、tao-skill-bank、TensorRT 和引用模板未在本证据中完整提供,且部分失败仍需用户自行诊断。按静态校准不超过10分。

适用触发11 / 15 · 3.7/5

触发短语、适用动作、原始 bp2 部署与微调边界、数据集类型、推理输入格式和不适用的训练检查点情形均有说明。扣分原因是需要 NVIDIA GPU、Docker、NVIDIA Container Toolkit、商业 bp2 检查点及可访问的数据路径;没有明确中文交互支持或中国大陆网络可达性说明,且示例使用 S3/容器生态,环境适配证据有限。

规范维护8 / 15 · 2.7/5

技能元数据包含名称、版本0.1.0、作者、许可证、兼容性和标签;文档按前置条件、步骤、参数、错误模式和部署引用分层组织。扣分原因是基准报告记录缺少 Instructions 和 Examples 推荐章节、作者格式不规范及目录层级问题;没有明确变更日志、维护负责人、支持周期或更新路径,且若干核心内容依赖未随证据完整展示的引用文件。

有效结果7 / 15 · 2.3/5

技能覆盖训练、评估、推理、导出、TensorRT 引擎生成和部署,并给出可直接改写的 YAML/Python 参数块、检查指标和七步流程,核心任务在文档层面可行。扣分原因是未执行验证,输出质量和约10倍延迟优势没有在本次静态审查中独立确认;用户仍需准备容器、GPU、数据、bp2 检查点并处理多个路径与配置细节。按静态校准最高7分。

证据核验5 / 10 · 2.5/5

证据包含固定版本元数据、提交修订、参数模板、错误模式、评估任务和一份 NVSkills-Eval 报告;报告披露了安全、正确性和可发现性结果以及静态检查发现。扣分原因是测试集仅含一个任务、无负向任务,报告结果不能替代本次独立复现;没有多来源交叉验证,关键模型行为和性能主张主要依赖文档陈述。按静态校准最高5分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行前应明确确认 Docker、GPU、挂载路径和输出目录的写入范围;该技能没有提供自动回滚或清理策略。
  • 必须提供并验证与 bp2 架构匹配的 model_best_bp2_serialize.pth;缺少宽度覆盖、max_disparity=192 或 gwc_feature_normalize=true 可能导致形状错误或错误视差。
  • 动态部署输入若不满足步长约束可能在 status.json 显示成功但不生成结果;应检查实际输出文件而非只看退出状态。
  • 文档未证明中文体验或中国大陆网络可达性,S3、容器镜像和相关 TAO 依赖可能造成部署可用性风险。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA TAO Toolkit 中的 FastFoundationStereo(FFS)模型,用于双目深度估计。它覆盖训练、评估、导出、TensorRT 引擎生成和 PyT/TRT 推理,并通过统一的 TAO depth_net CLI 执行。FFS 是 FoundationStereo 的 bp2 商业蒸馏版本,采用剪枝后的层宽和序列化前向路径,目标是比完整 FoundationStereo 低约 10 倍延迟。运行需要 Docker、nvidia-container-toolkit、可从容器访问的数据,以及匹配的 bp2 商业检查点;未提供该检查点时可以验证流程,但指标不代表 bp2 模型性能。

读取双目图像对、可选的 GT 视差和遮挡掩码,并使用每行 2 至 4 列的标注文件。为 TAO depth_net 配置 FastFoundationStereo、数据集类型、15 个 bp2 模型宽度覆盖项及训练或部署参数。按需执行 train、evaluate、inference、export 和 gen_trt_engine,生成检查点、评估指标、视差样本、静态 FP32 ONNX 或 FP16 TensorRT 引擎。它还指导检查容器退出码、status.json 中的 KPI、训练损失及 PyT 与部署结果之间的差异。

  1. 需要在用户双目数据上微调 FFS,并完成从训练到 TensorRT 部署的视觉工程师。
  2. 已有 model_best_bp2_serialize.pth、希望直接评估或部署商业 bp2 模型的团队。
  3. 需要使用 Middlebury、KITTI、ETH3D、FSD、IsaacReal 或 Crestereo 数据集训练和评估的研究人员。
  4. 需要对无 GT 双目图像执行实时视差推理并检查输出样本的开发者。
  5. 需要将 FFS 导出为静态 ONNX 并生成 FP16 TensorRT 引擎的部署工程师。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖训练、评估、导出、TensorRT 部署和 PyT/TRT 推理的完整工作流。
  • 针对 FFS 的 bp2 固定模型宽度、max_disparity 和部署配置提供了明确约束。
  • 支持多种注册数据集以及不符合标准布局的 GenericDataset。
  • 包含错误模式、KPI 验证和父模型检查点传递方面的操作指导。
局限
  • 必须使用 Docker 和 nvidia-container-toolkit,并正确挂载数据、输出目录和检查点。
  • 原始部署和微调流程依赖 pre-trained bp2 商业检查点;源材料未提供该检查点。
  • 没有该检查点时只能验证流程,所得指标不代表 bp2 模型性能。
  • 源材料没有列出具体 GPU 型号、完整硬件兼容矩阵或独立测试套件。

如何安装这个 Skill?

使用仓库 README 提供的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-train-fast-foundation-stereo --yes

也可以指定 Codex:

npx skills add nvidia/skills --skill tao-train-fast-foundation-stereo --agent codex --yes

运行技能还需要 Docker 和 nvidia-container-toolkit。README 未说明该技能的独立软件包版本或单独安装命令。

如何使用这个 Skill?

向 Agent 提出与“train fast stereo”“real-time stereo disparity”“FastFoundationStereo”或“distilled stereo depth”相关的请求。准备可从容器访问的左右图像、可选 GT 视差和标注文件,并提供 bp2 检查点路径。对于训练,默认使用 AutoML;如需关闭,可明确说“disable AutoML”或设置 automl_policy: off。对于部署动作,先读取技能引用的 TAO Deploy 说明,再按 train、evaluate、inference、export、gen_trt_engine、inference、evaluate 的流程执行;无训练时可直接从 bp2 检查点开始。

这个 Skill 与同类方案有什么区别?

相较于完整 FoundationStereo,FFS 是其 bp2 商业蒸馏变体,使用剪枝后的每层宽度和序列化前向路径,目标是约 10 倍更低的延迟;其入口、动作、数据集类和部署链保持一致。

常见问题

没有 bp2 检查点还能使用吗?
可以用于验证训练或部署流程,但原始部署和微调需要 model_best_bp2_serialize.pth;没有它时,训练结果不应被视为 bp2 模型的代表性指标。
哪些数据格式受到支持?
标注文件每行可包含左图和右图,或再加 GT 视差及遮挡掩码。数据集名称支持 FSD、IsaacRealDataset、Crestereo、Middlebury、Eth3d、Kitti 和 GenericDataset。
为什么必须填写模型宽度覆盖项?
FFS 的 15 个模型宽度字段必须与 bp2 检查点完全匹配;省略字段会回退到不匹配的 TAO 默认值,并可能在前向计算时产生形状不匹配错误。
技能是否需要网络或 MCP 服务?
源材料明确要求 Docker、nvidia-container-toolkit、Shell 和文件系统访问,但没有声明 MCP 服务或特定网络 API 依赖。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

自动化与运维 ✓ NVIDIA · 官方

TAO Brev GPU 运行技能

在 Brev GPU 实例上运行和管理 TAO 训练、评估与推理任务。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 度量学习识别

为细粒度视觉识别训练可用于检索匹配的图像嵌入模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 本地 Docker 运行

帮助 AI 代理在本机或远程单节点 Docker GPU 主机上运行 TAO 作业。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

开发与工程 ✓ NVIDIA · 官方

TAO OCRNet 场景文字识别技能

用 NVIDIA TAO 训练并部署场景文字识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频推理标注流水线

把原始视频转换为带推理链的训练数据。

数据与分析 ✓ NVIDIA · 官方

TAO NVDINOv2 视觉表征训练

用无标签自蒸馏训练可复用的视觉特征骨干。

相关 Skills