数据与分析 ✓ NVIDIA · 官方 mask2formerimage-segmentationpanoptic-segmentationinstance-segmentationsemantic-segmentationtensorrtnvidia-tao

TAO Mask2Former 分割技能

指导使用 NVIDIA TAO 训练和部署 Mask2Former 分割模型。

FollowSkills 评估 · FSRS-2.0
不推荐
49/ 100 五分制 2.5 / 5
信任安全15 / 25 · 3.0/5

明确要求 Docker、nvidia-container-toolkit,并限制工具为 Read/Bash;说明了数据源、父作业产物和加密键映射,也未见恶意、窃密或破坏性默认行为。扣分在于 Bash 权限较宽、没有用户确认或回滚流程,数据可能经 S3、Weights 下载和启用的 W&B 流转,敏感数据处理与外部网络效果披露不足。

可靠稳定8 / 20 · 2.0/5

文档覆盖训练、评估、推理、导出、量化、多 GPU 和若干错误模式,并给出确定性训练默认值。扣分在于模板默认值与文档要求存在偏差(如 ADE 与 COCO panoptic),AutoML、部署引用和旧 PyTorch 兼容性依赖外部组件,未提供可在此静态审查中复现的完整测试套件;按静态校准不得超过10分。

适用触发8 / 15 · 2.7/5

触发语、任务范围、数据格式、硬件要求和主要非适用条件较清楚,覆盖 panoptic、instance、semantic 任务。扣分在于缺少明确的中文使用说明和语义误触发边界,强依赖 Docker、NVIDIA GPU、TAO 容器、S3/GitHub 等环境;海外依赖可能降低中国大陆网络可达性。

规范维护9 / 15 · 3.0/5

SKILL.md 结构较完整,包含元数据、版本、作者、参数、模板、错误模式、部署说明和许可证;仓库 README 还说明了同步维护和安装入口。扣分在于缺少 Instructions、Examples、FAQ、changelog 和明确维护责任人或更新路径,作者格式不完整,且 schemas 目录的打包约定在基准报告中被标为结构问题。

有效结果6 / 15 · 2.0/5

技能直接覆盖 TAO Mask2Former 的训练到部署流程,提供数据路径映射、配置模板、父模型推断和常见故障处理,理论上能减少手工配置。扣分在于没有本审查可独立验证的代表性输出,数据与模型产物仍需用户准备,模板与运行时版本差异可能导致额外修正;静态校准下不超过7分。

证据核验3 / 10 · 1.5/5

提供了提交版本、配置 schema 元数据、动作命令、模板和错误说明,基准文件也记录了一次单任务评估。扣分在于基准仅有一个正向任务、无负向任务,未提供可独立核验的 CI 或完整测试覆盖,且评估结果属于仓库内声明而非独立交叉证据;静态审查下不得超过5分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行前应核对 TAO 容器版本、生成的 schemas/templates、数据集格式和 COCO 类别 ID 设置;文档模板默认值并不总与正文要求一致。
  • 训练和推理可能访问 S3、GitHub 预训练权重及 W&B;不要提供未经授权的敏感数据或凭据,并确认网络、数据驻留和外部上传策略。
  • 建议在隔离环境中先进行小规模验证,并保留检查点和输出目录以便人工恢复。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 NVIDIA TAO Mask2Former 的通用图像分割流程,覆盖全景、实例和语义分割。它指导模型训练、评估、推理、ONNX 导出、量化以及 TensorRT 部署相关操作。技能包含数据集要求、规格覆盖参数、AutoML 训练策略、多 GPU 配置、导出限制和常见错误处理。运行需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU;模型分割任务内存占用较高。

读取技能内的部署参考、生成的 TAO schema、规格模板和 AutoML 配置;根据动作要求构造 COCO 或 COCO panoptic 数据源路径,并指导 train、evaluate、inference、export、quantize 和 TensorRT 部署流程。它说明检查点、ONNX 文件、TensorRT 引擎和结果目录等参数如何从父作业或当前作业推断,并给出 Swin 主干预训练权重、类别数、分割模式、GPU 数量和数据路径的配置方式。

  1. 计算机视觉工程师需要用 COCO panoptic 数据训练全景分割模型时,使用该技能配置数据源、类别数、训练周期和 GPU。
  2. 模型评估人员需要对已训练的 Mask2Former 检查点执行验证时,使用该技能准备评估数据和检查点参数。
  3. 部署工程师需要将 Mask2Former 导出为 ONNX 并生成 TensorRT 引擎时,使用该技能遵循部署参考和默认导出尺寸。
  4. 团队需要运行语义、实例或全景分割推理时,使用该技能选择 model.mode 并配置对应数据文件。
  5. GPU 资源有限或遇到 CUDA 内存不足时,使用该技能调整图像分辨率或选择更小的 Swin 变体。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 Mask2Former 的训练、评估、推理、导出、量化和 TensorRT 部署流程。
  • 明确列出 COCO panoptic 数据文件、规格键和每个动作的数据要求。
  • 提供 AutoML 训练策略、检查点推断、多 GPU 配置和常见错误处理。
  • 说明 TensorRT 仅支持 FP32 和 FP16,并给出可工作的默认导出尺寸。
局限
  • 依赖 Docker、nvidia-container-toolkit 和至少一块 NVIDIA GPU;推荐 4 块 GPU 和每卡 24GB 以上显存。
  • Mask2Former 内存占用高,默认每 GPU batch size 为 1。
  • 每个动作都要求构造数据源路径,使用者必须准备符合要求的 COCO 或 COCO panoptic 文件。
  • TensorRT 不支持 INT8;小于默认导出尺寸的测试尺寸可能触发 ONNX 形状推断错误。

如何安装这个 Skill?

使用仓库 README 支持的 skills CLI 安装指定技能:

npx skills add nvidia/skills --skill tao-train-mask2former --yes

CLI 会提示或确定安装目标;无需手动克隆仓库或复制技能目录。源材料未说明特定客户端之外的安装目录细节。

如何使用这个 Skill?

安装后,在支持 Agent Skills 的客户端中提出明确任务,例如:"训练 Mask2Former 全景分割模型"、"评估这个 Mask2Former 检查点" 或 "导出 Mask2Former ONNX 并部署 TensorRT"。处理 TensorRT 引擎生成、TensorRT evaluate 或 TensorRT inference 前,应先读取 references/tao-deploy-mask2former.md。所有训练、评估、推理和量化动作都必须提供表中要求的数据源路径。

常见问题

这个技能是否适合没有 NVIDIA GPU 的环境?
不适合直接运行。SKILL.md 明确要求 Docker、nvidia-container-toolkit 和 NVIDIA GPU,最低要求为 1 块 GPU。
它支持哪些分割模式?
支持 panoptic、instance 和 semantic 三种模式;默认模式是 panoptic。
是否可以关闭 AutoML?
可以。训练时可将本次运行的 automl_policy 设为 off,或使用“关闭 AutoML”“no HPO”“plain training”等请求;这不会改变模型元数据。
量化是否支持 INT8?
TensorRT 数据类型仅支持 FP32 和 FP16,明确不支持 INT8。ONNX 量化有额外的 backend、mode、数据尺寸和模型依赖要求。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAE 视觉预训练技能

指导 NVIDIA TAO 使用掩码自编码器进行视觉预训练与微调。

数据与分析 ✓ NVIDIA · 官方

TAO ChangeNet 根因分析

基于图像证据定位 NVIDIA TAO Visual ChangeNet 分类实验的模型失败原因。

数据与分析 ✓ NVIDIA · 官方

TAO DAFT 数据集验证器

用 tao-daft validate 检查 TAO DAFT 数据集的结构、架构与交叉引用错误。

数据与分析 ✓ NVIDIA · 官方

TAO CLIP 微调与部署

为图文检索、零样本分类和嵌入提取训练并部署 NVIDIA TAO CLIP 模型。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

数据与分析 ✓ NVIDIA · 官方

NV-Segment-CTMR 医学影像分割

在 CT 或 MRI NIfTI 体数据上运行分割并生成可核查证据。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO DEFT AOI 检测优化循环

为 PCB 视觉检测模型自动执行评估、缺陷增强、挖掘、重训与部署门控。

相关 Skills