数据与分析 ✓ NVIDIA · 官方 masked-autoencoderself-supervised-learningcomputer-visionimage-classificationpytorchnvidia-taoautoml

TAO MAE 视觉预训练技能

指导 NVIDIA TAO 使用掩码自编码器进行视觉预训练与微调。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全13 / 25 · 2.6/5

技能限定为 Read 和 Bash,并明确依赖 Docker/NVIDIA Container Toolkit;但会处理数据集、检查点、S3 路径和 encryption_key,未说明敏感数据保护、最小化权限、用户确认、网络流向、回滚或失败恢复,因此扣分。未见恶意软件、凭据窃取、隐蔽外传或破坏性默认值等红线风险。

可靠稳定7 / 20 · 1.8/5

SKILL.md、skill_info.yaml 和模板对 train/evaluate/export/inference 的命令、输入、输出及若干错误模式有较一致说明,且标注确定性训练设置;但静态审查未执行关键路径,依赖版本、环境复现、异常输入反馈和完整测试覆盖不足,按静态上限不超过10,故扣分。

适用触发10 / 15 · 3.3/5

触发词、MAE 的 pretrain/finetune 场景、动作范围、数据格式、硬件要求和不适用的预训练推理场景较清楚;但缺少更完整的非适用边界、输出契约和中文使用说明,Docker/NVIDIA GPU 门槛较高,也未证明大陆网络环境下相关镜像或数据源可达,因此扣分。

规范维护8 / 15 · 2.7/5

技能包含 front matter、版本0.1.0、作者、Apache-2.0 声明、参数表、模板和错误模式,结构可读;但缺少明确的 Instructions/Examples 分节,维护责任、变更记录、依赖版本和更新路径不完整,author 格式也被基准报告标为不符合规范;提供的许可元数据为 NOASSERTION,故未给高分。

有效结果6 / 15 · 2.0/5

文档覆盖数据源映射、AutoML 路由、阶段选择、检查点传递、导出和部署入口,理论上可完成核心 TAO MAE 工作流;但没有静态可验证的代表性最终产物,部署参考文件内容不完整,且高 GPU/显存成本和若干模板/运行时假设可能导致额外人工修正,因此按静态上限不超过7并扣分。

证据核验4 / 10 · 2.0/5

存在带日期的单任务 NVSkills-Eval 报告及结果摘要,并给出静态检查发现;但仅一项正向任务、无负向触发覆盖、无原始日志或提交测试覆盖该技能关键路径,无法独立复现或交叉 corroborate 主要结论,按静态上限不超过5。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应确认 Docker、NVIDIA Container Toolkit、GPU 显存、TAO 容器镜像和数据源的可用性及网络可达性。
  • 不要将真实 encryption_key、凭据或敏感数据直接写入提示、日志、S3 示例或共享配置;技能未规定其保护和清理方式。
  • 应先确认 train.stage、model.arch、num_classes、输入尺寸与检查点一致,并验证 tar 包已按要求解压,否则可能产生零样本或形状不匹配。
  • AutoML 默认开启且可能触发额外计算;技能虽描述了 on/off 覆盖,但未提供完整的用户确认、成本上限或回滚流程。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导 AI 代理使用 NVIDIA TAO 的 MAE 模型进行自监督预训练和分类微调。它覆盖 train、evaluate、inference 和 export 操作,并通过 TensorRT 部署流程生成推理引擎。训练支持 pretrain 和 finetune 阶段,且默认将 AutoML 作为训练路径。运行环境需要 Docker 与 nvidia-container-toolkit;预训练最低需要 2 张 GPU,推荐 8 张,每张显存至少 24GB。

读取 TAO MAE 的技能说明、部署文档、数据集要求、生成的 schema 和 spec 模板;为 train、evaluate、inference 构造必需的数据源路径;指导代理调用 PyTorch mae CLI 的 train、evaluate、inference 和 export 操作;在符合条件时将训练路由到 tao-run-automl;处理检查点、输出目录、加密密钥和 ONNX 导出路径等参数推断;通过独立部署流程生成 TensorRT 引擎。

  1. 计算机视觉工程师希望使用未标注图像进行 MAE 自监督预训练,以学习视觉表示。
  2. 模型开发者已有预训练 MAE 权重,需要在图像分类数据集上进行微调。
  3. MLOps 工程师需要评估微调检查点或运行分类推理。
  4. 部署工程师需要将 MAE 模型导出为 ONNX 并通过 TAO Deploy 生成 TensorRT 引擎。
  5. TAO 用户希望在训练阶段启用或按单次运行关闭 AutoML。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖预训练、微调、评估、推理、导出和 TensorRT 部署相关流程。
  • 提供明确的数据集归档格式、动作级数据源要求和关键参数约束。
  • 支持 ConvNeXtV2、ViT 和 Hiera 等架构族,并提供 AutoML 训练策略。
  • 包含检查点和父作业结果目录的参数推断规则。
局限
  • MAE 预训练最低需要 2 张 GPU,推荐 8 张,且每张 GPU 需要 24GB 以上显存。
  • 需要 Docker 和 nvidia-container-toolkit,适合具备 NVIDIA GPU 容器环境的用户。
  • 预训练阶段不能直接用于推理或分类式评估,必须使用 finetune 检查点。
  • 本地 Docker 运行不能直接把 tar 路径交给 MAE CLI,否则可能产生零样本数据加载器。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装单个技能:

npx skills add nvidia/skills --skill tao-train-mask-auto-encoder --yes

也可以指定 Codex:

npx skills add nvidia/skills --skill tao-train-mask-auto-encoder --agent codex --yes

运行环境还需要 Docker 和 nvidia-container-toolkit。

如何使用这个 Skill?

安装后,向代理提出与 MAE 相关的任务,例如“pretrain MAE”“self-supervised vision pretraining”“Masked Autoencoder”或“MAE fine-tune”。训练时提供训练集和验证集数据源;评估和推理时提供对应的验证集或测试集归档,并使用 finetune 检查点。直接使用本地 Docker 时,应先解压 images_train.tar.gz、images_val.tar.gz 或 images_test.tar.gz,再将路径指向解压后的目录。部署 TensorRT 引擎前,代理应先读取 references/tao-deploy-mask-auto-encoder.md。

常见问题

这个技能适合没有 NVIDIA GPU 的环境吗?
不适合。技能明确要求 Docker 与 nvidia-container-toolkit;MAE 预训练最低需要 2 张 GPU,推荐 8 张,每张显存至少 24GB。
可以关闭 AutoML 吗?
可以。对单次训练请求设置 automl_policy: off,或使用“关闭 AutoML”“disable AutoML”“no HPO”等表达;模型层面的 AutoML 元数据不会因此改变。
预训练检查点可以直接做推理吗?
不可以。MAE 预测数据加载器不支持 train.stage: pretrain;推理和分类式评估应使用 finetune 检查点。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

数据与分析 ✓ NVIDIA · 官方

TAO Visual ChangeNet 工业视觉检测

训练和部署用于 PCB 缺陷检测的图像分类与变化分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML + DEFT 三阶段训练管线

为 AOI 与其他 DEFT 应用串联超参数优化、数据改进和最终模型精调。

数据与分析 ✓ NVIDIA · 官方

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVDINOv2 视觉表征训练

用无标签自蒸馏训练可复用的视觉特征骨干。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO 姿态分类

用 ST-GCN 将姿态关键点序列分类为动作类别。

数据与分析 ✓ NVIDIA · 官方

TAO Mask2Former 分割技能

指导使用 NVIDIA TAO 训练和部署 Mask2Former 分割模型。

数据与分析 ✓ NVIDIA · 官方

Hugging Face 本地 GPU 微调助手

在本地 NVIDIA GPU 上,以可复现流程微调 Hugging Face 模型。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO VCN 分类缺口分析

定位最脆弱的VCN分类样本并生成增强候选队列。

数据与分析 ✓ NVIDIA · 官方

TAO ChangeNet 根因分析

基于图像证据定位 NVIDIA TAO Visual ChangeNet 分类实验的模型失败原因。

相关 Skills