TAO 度量学习识别
为细粒度视觉识别训练可用于检索匹配的图像嵌入模型。
技能声明仅允许 Read 和 Bash,并要求 Docker/NVIDIA Container Toolkit;数据源、检查点推断、上传排除项和不可信检查点不得使用特定环境变量等边界有一定说明。未明确用户确认、敏感数据处理、最小化 Bash 权限、外部网络/云存储影响、回滚和完整数据流,因此扣分。
动作、输入输出、模板、参数和若干错误模式有文档支持,且声明确定性训练设置;但缺少可执行的故障恢复流程和关键路径复现证据,训练依赖外部 TAO/AutoML 组件,模板与动作说明存在可疑不一致,静态上限内扣分。
触发短语、训练/评估/推理/导出/部署场景、GPU要求和数据结构较清楚;但主要面向 TAO、Docker 和 NVIDIA GPU,单节点限制明显,未说明非适用范围、中文使用或中国大陆网络可达性,因此扣分。
有名称、描述、Apache-2.0 标注、版本、作者、引用资料、schema/template 结构和维护者线索;但缺少 Instructions、Examples、FAQ、变更日志、明确维护责任/更新路径,基准还报告目录层级、作者格式和缺失推荐章节问题,因此扣分。
文档覆盖从训练到导出和 TensorRT 部署的核心配置,并提供数据源和参数示例,理论上可减少配置工作;但没有足够的代表性输出或静态可验证的端到端结果,且 AutoML、SDK、容器和数据集依赖会造成较高使用成本,因此未接近满分。
存在结构化 skill_info、模板、评估任务和一份外部基准报告,提供有限审计线索;但基准仅含一个任务、一次尝试,缺少技能专属 CI/测试覆盖和独立多源复核,静态证据不足以超过5分。
- 执行前应确认 Bash、Docker、GPU、数据集路径和云存储权限,尤其是示例中的 S3 数据源。
- 不要对不可信检查点设置 TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1;该设置可能扩大反序列化风险。
- 应先核对 evaluate/export/inference 模板与 skill_info、TAO 版本及引用 references 文件是否一致;当前静态材料未证明端到端可运行。
- 未提供大陆网络可达性或中文操作说明,外部 TAO/容器镜像和数据源可能无法直接访问。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO Toolkit 的度量学习识别模型,用于零售商品识别等细粒度视觉匹配场景。它支持训练、评估、导出、推理及 TensorRT 部署流程,并使用三元组损失或对比损失学习嵌入。训练阶段默认启用 AutoML,并根据用户请求支持单次关闭。运行需要 Docker、nvidia-container-toolkit 和至少一块 NVIDIA GPU。
读取模型技能信息、训练 schema 和部署参考文件;根据动作要求构造训练、评估和推理数据源路径及 spec_overrides;通过 TAO AutoML 或直接训练流程启动训练;处理评估所需的 reference/query 数据集;指导 checkpoint 推断、ONNX 导出、推理和 TensorRT 操作;在可信 TAO checkpoint 的下游操作中处理 PyTorch 2.6 的加载设置。
- 需要为零售商品或其他细粒度类别训练检索嵌入的视觉机器学习团队。
- 希望使用 reference/query 数据集评估跨类别检索性能的 TAO 用户。
- 需要从训练结果导出 ONNX 或生成 TensorRT 引擎的部署工程师。
- 需要对未知类别测试图像执行嵌入检索推理的应用开发者。
这个 Skill 有哪些优点和局限?
- 覆盖训练、评估、导出、推理和 TensorRT 部署相关流程。
- 提供模型、数据集、checkpoint 推断和关键超参数说明。
- 支持默认启用的 AutoML 训练路径,并允许按运行关闭 AutoML。
- 明确要求 reference/query 数据集,有助于检索指标评估。
- 要求 Docker、nvidia-container-toolkit 和 NVIDIA GPU,最低需要 1 块 GPU,推荐 2 块及每块 16GB 以上显存。
- 技能面向单节点 Lightning 管理的多 GPU 场景,没有显式的多节点配置。
- 源材料没有提供完整安装镜像、数据集获取流程或端到端运行命令。
- PyTorch 2.6 checkpoint 加载设置仅适用于同一可信 TAO 工作流产生的 checkpoint,不应对不可信文件使用。
如何安装这个 Skill?
使用仓库 README 支持的 Skills CLI 命令安装指定技能:
npx skills add nvidia/skills --skill tao-train-metric-learning-recognition --yes
也可以针对 Codex 安装:
npx skills add nvidia/skills --skill tao-train-metric-learning-recognition --agent codex --yes
如何使用这个 Skill?
安装后,用明确的任务提示激活技能,例如:“train metric learning for retail product recognition”或“run ml-recog inference with retrieval embeddings”。准备 Docker、nvidia-container-toolkit、NVIDIA GPU 以及符合技能要求的训练或评估数据集。训练时应提供数据源覆盖项;评估需要 reference 和 query 数据集。数据存储配置之外的完整运行命令未在源材料中给出。