数据与分析 ✓ NVIDIA · 官方 clipvision-languageimage-text-retrievalzero-shot-classificationembeddingsonnxtensorrt

TAO CLIP 微调与部署

为图文检索、零样本分类和嵌入提取训练并部署 NVIDIA TAO CLIP 模型。

FollowSkills 评估 · FSRS-2.0
不推荐
55/ 100 五分制 2.8 / 5
信任安全17 / 25 · 3.4/5

文档明确限制受信任检查点的权重加载覆盖,并警告不要对不受信任检查点设置该变量;数据集、检查点、ONNX 和 TensorRT 工件的数据流也有说明。扣分原因是允许 Bash、Docker 挂载和 GPU/容器操作,但缺少逐步用户确认、权限隔离、回滚方案、敏感数据处理和外部副作用控制说明;许可证元数据为 NOASSERTION,虽有文件内 Apache-2.0 声明,仍存在治理歧义。

可靠稳定8 / 20 · 2.0/5

文档覆盖 train、evaluate、inference、export、TensorRT 部署、常见错误及检查点陷阱,并给出可诊断的失败反馈。扣分原因是静态审查无法验证关键路径;没有随技能提供覆盖核心动作的测试套件,且 evaluate 模板与主说明存在字段结构差异,依赖 Docker、TAO 镜像和外部运行环境。

适用触发11 / 15 · 3.7/5

触发场景、支持动作、模型、数据格式、输入文件和 TensorRT/ PyTorch 边界总体清晰,也明确说明空检查点推理失败和图像分类数据不能直接当作 CLIP 数据。扣分原因是未说明中文交互支持或中国大陆网络可达性,核心流程依赖 Docker、NVIDIA 容器和 TAO 镜像;非 NVIDIA GPU、缺少镜像或无法访问镜像仓库的环境适配不足。

规范维护9 / 15 · 3.0/5

SKILL.md 采用分层说明,并引用错误模式、参数推断、模板和部署文档;包含版本号、作者和多个配置示例。扣分原因是基准报告指出缺少 Examples 推荐章节、作者格式不符合要求和根目录 schemas 结构异常;没有明确维护责任、变更日志或更新承诺,且给定许可证元数据为 NOASSERTION。

有效结果6 / 15 · 2.0/5

技能直接覆盖训练、评估、嵌入提取、ONNX 导出和 TensorRT 引擎生成,说明了输出文件、必要输入和常见修复方式,具备较高的潜在实用性。扣分原因是没有静态可核验的代表性产物或完整端到端复现证据;基准仅含一个任务,不能充分证明跨动作、边界条件和相对替代方案的收益。

证据核验4 / 10 · 2.0/5

文件提供了固定版本、配置模板、动作命令、参数映射、错误模式和一份带日期的基准报告,关键判断可追溯到源文件。扣分原因是基准只有一个任务且缺少原始日志、测试代码和独立复现实验;报告中的执行结果在本次静态审查中无法验证,因此不超过静态上限。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行前应确认 Docker、nvidia-container-toolkit、TAO 训练/部署镜像及 GPU 环境可用,并验证镜像和检查点来源。
  • 不要对不受信任的 PyTorch 检查点设置 TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1;训练、导出和部署可能覆盖或生成大量工件,应先确认输出目录和保留策略。
  • 许可证、作者格式、schemas 布局、evaluate 模板差异及缺少端到端测试应在发布前修正或明确说明。
  • 中国大陆用户可能受到 NVIDIA 镜像、Docker 仓库或相关服务网络可达性的影响。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA TAO 中的 CLIP 工作流,覆盖训练、评估、推理、ONNX 导出和 TensorRT 引擎生成。它支持自定义图像/字幕数据集和 WebDataset 分片,并提供 OpenCLIP、Radio-CLIP 与 SigLIP2 模型选项。运行环境需要 Docker 和 NVIDIA Container Toolkit。技能还说明了检查点解析、PyTorch 2.6 加载限制以及 TensorRT 图文引擎的部署要求。

读取按动作所需的图像、字幕、提示词、列表、检查点或 ONNX 文件路径,并将其写入 TAO 配置覆盖项;运行 CLIP 的 train、evaluate、inference、export 和 gen_trt_engine 动作;生成 ONNX 模型、TensorRT 引擎,以及推理结果目录中的 L2 归一化 image_embeddings.h5 和 text_embeddings.h5 文件;训练阶段默认通过 TAO AutoML 路由,并支持关闭本次运行的 AutoML。

  1. 需要用图像-字幕数据进行领域适配的计算机视觉工程师,可使用自定义数据集或 WebDataset 训练 CLIP。
  2. 需要在没有专门分类器训练的情况下执行图像零样本分类的团队,可使用提示词进行推理。
  3. 需要计算图像或文本向量并保存为 HDF5 的检索开发者,可使用 embedding inference。
  4. 需要将训练所得模型转换为 ONNX 或 TensorRT 的部署工程师,可使用 export 和 gen_trt_engine。
  5. 使用 Radio-CLIP 或高分辨率 OpenCLIP 模型的团队,可按模型要求配置适配器和 GPU 资源。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖从训练到 ONNX/TensorRT 部署的完整 CLIP 流程。
  • 明确区分自定义图像/字幕数据、WebDataset 和推理提示词要求。
  • 支持 OpenCLIP/NV-CLIP、Radio-CLIP 和 SigLIP2 多种模型。
  • 记录了空检查点推理失败、PyTorch 2.6 检查点加载和 TensorRT 文本引擎等具体故障模式。
局限
  • 必须具备 Docker、NVIDIA Container Toolkit 和 TAO 运行环境。
  • 训练数据必须是图文配对数据;不能未经许可把普通图像分类数据当作 CLIP 数据。
  • 仅有视觉 TensorRT 引擎时,无法进行完整图文检索评估或文本推理。
  • 仓库级元数据标为 NOASSERTION;README 另称项目采用 Apache 2.0 与 CC BY 4.0 双许可证,采用前应核对许可证适用范围。

如何安装这个 Skill?

使用仓库 README 提供的命令安装指定技能:

npx skills add nvidia/skills --skill tao-finetune-clip --yes

也可以针对 Codex 安装:

npx skills add nvidia/skills --skill tao-finetune-clip --agent codex --yes

运行环境还需要 Docker 和 NVIDIA Container Toolkit。来源未说明单独复制技能目录的其他安装步骤。

如何使用这个 Skill?

向已加载该技能的代理提出具体 TAO CLIP 任务,例如:“使用我的图像和字幕数据微调 CLIP,并导出 TensorRT 引擎。”代理应先确定动作,再准备相应数据路径和配置覆盖项。训练需要 image_text 数据;推理至少提供图像数据集或 prompts.txt。检查点相关的评估、推理、导出和恢复训练应使用精确的父训练输出检查点;TensorRT 的引擎生成、评估和推理需在 TAO Deploy 镜像中运行。

常见问题

这个技能是否需要预训练检查点?
不一定。导出动作可在 export.checkpoint 为 null 时构造选定架构,但 inference.checkpoint 为 null 会在嵌入提取前失败;检查点相关流程应使用父训练作业输出的精确检查点。
普通图像分类数据能否直接用于训练?
不能默认这样做。只有用户明确允许 plumbing-only 验证回退时,才可依据类别标签生成字幕,并应记录这一点。
TensorRT 部署需要什么引擎?
完整图文检索评估和图文推理需要文本能力的引擎;separate 导出通常需要分别构建匹配的视觉和文本引擎。图像-only 推理只需视觉引擎。

同仓库的其他 Skills

均来自 NVIDIA/skills

开发与工程 ✓ NVIDIA · 官方

DeepStream 视觉模型导入助手

将目标检测模型自动接入 NVIDIA DeepStream 并生成基准报告。

数据与分析 ✓ NVIDIA · 官方

Cosmos-Embed 视频检索与微调技能

用 Cosmos-Embed1 将视频与文本嵌入用于检索和微调。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

数据与分析 ✓ NVIDIA · 官方

TAO 度量学习识别

为细粒度视觉识别训练可用于检索匹配的图像嵌入模型。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

Nemotron 检索配方助手

帮助规划、调试、微调、评估和部署 Nemotron 嵌入与重排检索流程。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO Mask2Former 分割技能

指导使用 NVIDIA TAO 训练和部署 Mask2Former 分割模型。

开发与工程 ✓ NVIDIA · 官方

TAO OCRNet 场景文字识别技能

用 NVIDIA TAO 训练并部署场景文字识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVDINOv2 视觉表征训练

用无标签自蒸馏训练可复用的视觉特征骨干。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

开发与工程 ✓ NVIDIA · 官方

NVIDIA DeepStream 开发技能

为 Python pyservicemaker 驱动的 DeepStream 视频分析流水线提供可靠开发指导。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

相关 Skills