数据与分析 ✓ NVIDIA · 官方 image-segmentationpanoptic-segmentationinstance-segmentationsemantic-segmentationnvidia-taotensorrtautoml

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

FollowSkills 评估 · FSRS-2.0
不推荐
53/ 100 五分制 2.7 / 5
信任安全15 / 25 · 3.0/5

技能声明仅使用 Read 和 Bash,并明确依赖 Docker、NVIDIA Container Toolkit、GPU、S3 数据路径及预训练权重下载;未见恶意行为、凭据窃取或隐蔽外传,但缺少最小权限细化、用户确认、敏感数据处理、网络依赖审计和回滚方案,因此扣分。

可靠稳定9 / 20 · 2.3/5

文档提供了动作映射、数据要求、检查点选择规则、确定性配置和多项错误模式,支持较好的静态可诊断性;但未执行复现,依赖版本和关键运行环境不完整,且存在默认 1 GPU 与最低 2 GPU 要求等张力,因此受静态上限限制并扣分。

适用触发10 / 15 · 3.3/5

目标用户、OneFormer 的训练/评估/推理/导出/量化场景和触发短语较清楚,也说明了非训练动作边界;但非适用范围、语义误触发条件、中文支持及中国大陆网络可达性没有说明,且硬件门槛较高,因此扣分。

规范维护8 / 15 · 2.7/5

技能包含 front matter、版本、作者、许可证、动作表、参数说明、错误模式和引用文件,结构较完整;但缺少独立的 Instructions、Examples、FAQ、变更日志和明确维护责任,许可证元数据为 NOASSERTION 与技能声明的 Apache-2.0 存在治理歧义,因此扣分。

有效结果7 / 15 · 2.3/5

文档覆盖从数据准备到训练、检查点评估、导出、推理和量化的核心流程,并给出可直接改写的 spec overrides;提交的单任务 benchmark 报告显示技能辅助任务通过,但没有实际模型结果或多样化任务覆盖,故仅给静态上限内的较高分。

证据核验4 / 10 · 2.0/5

存在结构化 schemas、skill_info、spec templates、evals.json 和 benchmark 报告,关键规则可追溯;但 benchmark 仅有 1 个任务、无提交的测试套件或 CI 复现链,也缺少独立交叉来源,因此证据覆盖有限并扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应确认 Docker、NVIDIA Container Toolkit、GPU 数量/显存、TAO 镜像和所有外部权重来源,并审查 S3 数据是否含敏感信息。
  • 不要直接采用 latest 检查点或不受信任检查点;应验证解析后的具体路径,并谨慎使用 TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1。
  • 应补充中文用户说明、中国大陆网络可达性、版本兼容矩阵、示例和可复现测试。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA TAO OneFormer,用于通用图像分割工作流。它覆盖训练、评估、推理、导出、量化及 TensorRT 部署相关操作。模型以任务条件化查询统一全景、实例和语义分割。运行需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU;训练至少需要 2 张 GPU,建议使用 24GB 以上显存。

读取技能内的配置、Schema、部署说明和规格模板;根据动作要求构造训练、评估、推理和量化数据路径;通过 TAO 工作流运行 OneFormer 训练或 AutoML,解析检查点,并将其用于评估、推理、导出、量化或 TensorRT 操作。它还指导设置类别数、任务模式、精度、输出路径和多 GPU 参数,并说明常见 CUDA、路径、检查点和 ONNX 导出错误的处理方式。

  1. 计算机视觉团队使用 COCO 全景数据训练同时支持语义、实例和全景分割的 OneFormer 模型。
  2. 模型工程师需要用已选检查点执行评估,并查看总体及每类 IoU。
  3. 部署团队将 OneFormer 导出为 ONNX、生成 TensorRT 引擎,或运行 TensorRT 评估和推理。
  4. 研究人员使用 AutoML 进行训练超参数搜索,或在明确要求时关闭 AutoML 执行普通训练。
  5. 平台工程师在多 GPU 环境中运行 Lightning 管理的 DDP 训练并排查显存或检查点加载问题。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 OneFormer 的训练、评估、推理、导出、量化和 TensorRT 部署流程。
  • 明确列出各动作的数据文件、规格覆盖项、检查点选择规则和常见失败模式。
  • 支持模型级 AutoML,并允许按运行选择启用或关闭。
  • 提供多 GPU、多节点 DDP 参数以及 COCO 全景数据的关键类别映射说明。
局限
  • 硬件要求高:最低 2 张 GPU,建议每张具备 24GB 以上显存,训练默认 50 个 epoch 且 batch size 为 1。
  • 明确要求 Docker 和 nvidia-container-toolkit;不适合无 NVIDIA GPU 的环境。
  • 技能正文没有给出完整的安装、执行命令或独立测试套件证据。
  • 数据源路径、检查点路径和父 AutoML 作业目录配置不正确时,评估、量化或推理可能失败。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装:

npx skills add nvidia/skills --skill tao-train-oneformer --yes

也可以先运行 npx skills add nvidia/skills --list 查看目录。无需克隆仓库或手动复制技能目录。

如何使用这个 Skill?

安装后,向支持 Agent Skills 的代理提出类似“train OneFormer for universal segmentation”或“export this TAO OneFormer model” 的请求。处理 TensorRT 引擎生成、TensorRT 评估或 TensorRT 推理前,应读取 references/tao-deploy-oneformer.md;训练阶段应读取 references/skill_info.yaml,并根据请求决定 automl_policy。必须为每个动作提供对应的数据源路径。具体 TAO 运行命令未在该技能正文中完整记录。

常见问题

这个技能是否免费?
提供的材料没有说明 TAO、Docker、GPU 云资源或其他运行环境的费用,不能据此判断总成本。
是否必须启用 AutoML?
不是。该模型默认使用 automl_policy: on;用户明确要求关闭 AutoML、禁用 HPO 或普通训练时,本次运行可使用 off。
为什么推理通过但没有预测结果?
技能指出推理读取 inference.images_dir,而不是 dataset.test.images;每次推理都必须正确声明并填充 inference.images_dir。
可以使用任意检查点吗?
应通过模型技能或 SDK 的父模型解析器选择具体检查点。除非用户明确要求 latest,否则不要仅按名称选择 oneformer_model_latest.pth。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO Mask2Former 分割技能

指导使用 NVIDIA TAO 训练和部署 Mask2Former 分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAE 视觉预训练技能

指导 NVIDIA TAO 使用掩码自编码器进行视觉预训练与微调。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

数据与分析 ✓ NVIDIA · 官方

TAO ChangeNet 根因分析

基于图像证据定位 NVIDIA TAO Visual ChangeNet 分类实验的模型失败原因。

数据与分析 ✓ NVIDIA · 官方

TAO DAFT 数据集验证器

用 tao-daft validate 检查 TAO DAFT 数据集的结构、架构与交叉引用错误。

数据与分析 ✓ NVIDIA · 官方

TAO CLIP 微调与部署

为图文检索、零样本分类和嵌入提取训练并部署 NVIDIA TAO CLIP 模型。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

相关 Skills