TAO CLIP 微调与部署
为图文检索、零样本分类和嵌入提取训练并部署 NVIDIA TAO CLIP 模型。
文档明确限制受信任检查点的权重加载覆盖,并警告不要对不受信任检查点设置该变量;数据集、检查点、ONNX 和 TensorRT 工件的数据流也有说明。扣分原因是允许 Bash、Docker 挂载和 GPU/容器操作,但缺少逐步用户确认、权限隔离、回滚方案、敏感数据处理和外部副作用控制说明;许可证元数据为 NOASSERTION,虽有文件内 Apache-2.0 声明,仍存在治理歧义。
文档覆盖 train、evaluate、inference、export、TensorRT 部署、常见错误及检查点陷阱,并给出可诊断的失败反馈。扣分原因是静态审查无法验证关键路径;没有随技能提供覆盖核心动作的测试套件,且 evaluate 模板与主说明存在字段结构差异,依赖 Docker、TAO 镜像和外部运行环境。
触发场景、支持动作、模型、数据格式、输入文件和 TensorRT/ PyTorch 边界总体清晰,也明确说明空检查点推理失败和图像分类数据不能直接当作 CLIP 数据。扣分原因是未说明中文交互支持或中国大陆网络可达性,核心流程依赖 Docker、NVIDIA 容器和 TAO 镜像;非 NVIDIA GPU、缺少镜像或无法访问镜像仓库的环境适配不足。
SKILL.md 采用分层说明,并引用错误模式、参数推断、模板和部署文档;包含版本号、作者和多个配置示例。扣分原因是基准报告指出缺少 Examples 推荐章节、作者格式不符合要求和根目录 schemas 结构异常;没有明确维护责任、变更日志或更新承诺,且给定许可证元数据为 NOASSERTION。
技能直接覆盖训练、评估、嵌入提取、ONNX 导出和 TensorRT 引擎生成,说明了输出文件、必要输入和常见修复方式,具备较高的潜在实用性。扣分原因是没有静态可核验的代表性产物或完整端到端复现证据;基准仅含一个任务,不能充分证明跨动作、边界条件和相对替代方案的收益。
文件提供了固定版本、配置模板、动作命令、参数映射、错误模式和一份带日期的基准报告,关键判断可追溯到源文件。扣分原因是基准只有一个任务且缺少原始日志、测试代码和独立复现实验;报告中的执行结果在本次静态审查中无法验证,因此不超过静态上限。
- 运行前应确认 Docker、nvidia-container-toolkit、TAO 训练/部署镜像及 GPU 环境可用,并验证镜像和检查点来源。
- 不要对不受信任的 PyTorch 检查点设置 TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1;训练、导出和部署可能覆盖或生成大量工件,应先确认输出目录和保留策略。
- 许可证、作者格式、schemas 布局、evaluate 模板差异及缺少端到端测试应在发布前修正或明确说明。
- 中国大陆用户可能受到 NVIDIA 镜像、Docker 仓库或相关服务网络可达性的影响。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO 中的 CLIP 工作流,覆盖训练、评估、推理、ONNX 导出和 TensorRT 引擎生成。它支持自定义图像/字幕数据集和 WebDataset 分片,并提供 OpenCLIP、Radio-CLIP 与 SigLIP2 模型选项。运行环境需要 Docker 和 NVIDIA Container Toolkit。技能还说明了检查点解析、PyTorch 2.6 加载限制以及 TensorRT 图文引擎的部署要求。
读取按动作所需的图像、字幕、提示词、列表、检查点或 ONNX 文件路径,并将其写入 TAO 配置覆盖项;运行 CLIP 的 train、evaluate、inference、export 和 gen_trt_engine 动作;生成 ONNX 模型、TensorRT 引擎,以及推理结果目录中的 L2 归一化 image_embeddings.h5 和 text_embeddings.h5 文件;训练阶段默认通过 TAO AutoML 路由,并支持关闭本次运行的 AutoML。
- 需要用图像-字幕数据进行领域适配的计算机视觉工程师,可使用自定义数据集或 WebDataset 训练 CLIP。
- 需要在没有专门分类器训练的情况下执行图像零样本分类的团队,可使用提示词进行推理。
- 需要计算图像或文本向量并保存为 HDF5 的检索开发者,可使用 embedding inference。
- 需要将训练所得模型转换为 ONNX 或 TensorRT 的部署工程师,可使用 export 和 gen_trt_engine。
- 使用 Radio-CLIP 或高分辨率 OpenCLIP 模型的团队,可按模型要求配置适配器和 GPU 资源。
这个 Skill 有哪些优点和局限?
- 覆盖从训练到 ONNX/TensorRT 部署的完整 CLIP 流程。
- 明确区分自定义图像/字幕数据、WebDataset 和推理提示词要求。
- 支持 OpenCLIP/NV-CLIP、Radio-CLIP 和 SigLIP2 多种模型。
- 记录了空检查点推理失败、PyTorch 2.6 检查点加载和 TensorRT 文本引擎等具体故障模式。
- 必须具备 Docker、NVIDIA Container Toolkit 和 TAO 运行环境。
- 训练数据必须是图文配对数据;不能未经许可把普通图像分类数据当作 CLIP 数据。
- 仅有视觉 TensorRT 引擎时,无法进行完整图文检索评估或文本推理。
- 仓库级元数据标为 NOASSERTION;README 另称项目采用 Apache 2.0 与 CC BY 4.0 双许可证,采用前应核对许可证适用范围。
如何安装这个 Skill?
使用仓库 README 提供的命令安装指定技能:
npx skills add nvidia/skills --skill tao-finetune-clip --yes
也可以针对 Codex 安装:
npx skills add nvidia/skills --skill tao-finetune-clip --agent codex --yes
运行环境还需要 Docker 和 NVIDIA Container Toolkit。来源未说明单独复制技能目录的其他安装步骤。
如何使用这个 Skill?
向已加载该技能的代理提出具体 TAO CLIP 任务,例如:“使用我的图像和字幕数据微调 CLIP,并导出 TensorRT 引擎。”代理应先确定动作,再准备相应数据路径和配置覆盖项。训练需要 image_text 数据;推理至少提供图像数据集或 prompts.txt。检查点相关的评估、推理、导出和恢复训练应使用精确的父训练输出检查点;TensorRT 的引擎生成、评估和推理需在 TAO Deploy 镜像中运行。