TAO MAE 视觉预训练技能
指导 NVIDIA TAO 使用掩码自编码器进行视觉预训练与微调。
技能限定为 Read 和 Bash,并明确依赖 Docker/NVIDIA Container Toolkit;但会处理数据集、检查点、S3 路径和 encryption_key,未说明敏感数据保护、最小化权限、用户确认、网络流向、回滚或失败恢复,因此扣分。未见恶意软件、凭据窃取、隐蔽外传或破坏性默认值等红线风险。
SKILL.md、skill_info.yaml 和模板对 train/evaluate/export/inference 的命令、输入、输出及若干错误模式有较一致说明,且标注确定性训练设置;但静态审查未执行关键路径,依赖版本、环境复现、异常输入反馈和完整测试覆盖不足,按静态上限不超过10,故扣分。
触发词、MAE 的 pretrain/finetune 场景、动作范围、数据格式、硬件要求和不适用的预训练推理场景较清楚;但缺少更完整的非适用边界、输出契约和中文使用说明,Docker/NVIDIA GPU 门槛较高,也未证明大陆网络环境下相关镜像或数据源可达,因此扣分。
技能包含 front matter、版本0.1.0、作者、Apache-2.0 声明、参数表、模板和错误模式,结构可读;但缺少明确的 Instructions/Examples 分节,维护责任、变更记录、依赖版本和更新路径不完整,author 格式也被基准报告标为不符合规范;提供的许可元数据为 NOASSERTION,故未给高分。
文档覆盖数据源映射、AutoML 路由、阶段选择、检查点传递、导出和部署入口,理论上可完成核心 TAO MAE 工作流;但没有静态可验证的代表性最终产物,部署参考文件内容不完整,且高 GPU/显存成本和若干模板/运行时假设可能导致额外人工修正,因此按静态上限不超过7并扣分。
存在带日期的单任务 NVSkills-Eval 报告及结果摘要,并给出静态检查发现;但仅一项正向任务、无负向触发覆盖、无原始日志或提交测试覆盖该技能关键路径,无法独立复现或交叉 corroborate 主要结论,按静态上限不超过5。
- 执行前应确认 Docker、NVIDIA Container Toolkit、GPU 显存、TAO 容器镜像和数据源的可用性及网络可达性。
- 不要将真实 encryption_key、凭据或敏感数据直接写入提示、日志、S3 示例或共享配置;技能未规定其保护和清理方式。
- 应先确认 train.stage、model.arch、num_classes、输入尺寸与检查点一致,并验证 tar 包已按要求解压,否则可能产生零样本或形状不匹配。
- AutoML 默认开启且可能触发额外计算;技能虽描述了 on/off 覆盖,但未提供完整的用户确认、成本上限或回滚流程。
这个 Skill 能做什么,适合哪些场景?
该技能指导 AI 代理使用 NVIDIA TAO 的 MAE 模型进行自监督预训练和分类微调。它覆盖 train、evaluate、inference 和 export 操作,并通过 TensorRT 部署流程生成推理引擎。训练支持 pretrain 和 finetune 阶段,且默认将 AutoML 作为训练路径。运行环境需要 Docker 与 nvidia-container-toolkit;预训练最低需要 2 张 GPU,推荐 8 张,每张显存至少 24GB。
读取 TAO MAE 的技能说明、部署文档、数据集要求、生成的 schema 和 spec 模板;为 train、evaluate、inference 构造必需的数据源路径;指导代理调用 PyTorch mae CLI 的 train、evaluate、inference 和 export 操作;在符合条件时将训练路由到 tao-run-automl;处理检查点、输出目录、加密密钥和 ONNX 导出路径等参数推断;通过独立部署流程生成 TensorRT 引擎。
- 计算机视觉工程师希望使用未标注图像进行 MAE 自监督预训练,以学习视觉表示。
- 模型开发者已有预训练 MAE 权重,需要在图像分类数据集上进行微调。
- MLOps 工程师需要评估微调检查点或运行分类推理。
- 部署工程师需要将 MAE 模型导出为 ONNX 并通过 TAO Deploy 生成 TensorRT 引擎。
- TAO 用户希望在训练阶段启用或按单次运行关闭 AutoML。
这个 Skill 有哪些优点和局限?
- 覆盖预训练、微调、评估、推理、导出和 TensorRT 部署相关流程。
- 提供明确的数据集归档格式、动作级数据源要求和关键参数约束。
- 支持 ConvNeXtV2、ViT 和 Hiera 等架构族,并提供 AutoML 训练策略。
- 包含检查点和父作业结果目录的参数推断规则。
- MAE 预训练最低需要 2 张 GPU,推荐 8 张,且每张 GPU 需要 24GB 以上显存。
- 需要 Docker 和 nvidia-container-toolkit,适合具备 NVIDIA GPU 容器环境的用户。
- 预训练阶段不能直接用于推理或分类式评估,必须使用 finetune 检查点。
- 本地 Docker 运行不能直接把 tar 路径交给 MAE CLI,否则可能产生零样本数据加载器。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装单个技能:
npx skills add nvidia/skills --skill tao-train-mask-auto-encoder --yes
也可以指定 Codex:
npx skills add nvidia/skills --skill tao-train-mask-auto-encoder --agent codex --yes
运行环境还需要 Docker 和 nvidia-container-toolkit。
如何使用这个 Skill?
安装后,向代理提出与 MAE 相关的任务,例如“pretrain MAE”“self-supervised vision pretraining”“Masked Autoencoder”或“MAE fine-tune”。训练时提供训练集和验证集数据源;评估和推理时提供对应的验证集或测试集归档,并使用 finetune 检查点。直接使用本地 Docker 时,应先解压 images_train.tar.gz、images_val.tar.gz 或 images_test.tar.gz,再将路径指向解压后的目录。部署 TensorRT 引擎前,代理应先读取 references/tao-deploy-mask-auto-encoder.md。