TAO Mask2Former 分割技能
指导使用 NVIDIA TAO 训练和部署 Mask2Former 分割模型。
明确要求 Docker、nvidia-container-toolkit,并限制工具为 Read/Bash;说明了数据源、父作业产物和加密键映射,也未见恶意、窃密或破坏性默认行为。扣分在于 Bash 权限较宽、没有用户确认或回滚流程,数据可能经 S3、Weights 下载和启用的 W&B 流转,敏感数据处理与外部网络效果披露不足。
文档覆盖训练、评估、推理、导出、量化、多 GPU 和若干错误模式,并给出确定性训练默认值。扣分在于模板默认值与文档要求存在偏差(如 ADE 与 COCO panoptic),AutoML、部署引用和旧 PyTorch 兼容性依赖外部组件,未提供可在此静态审查中复现的完整测试套件;按静态校准不得超过10分。
触发语、任务范围、数据格式、硬件要求和主要非适用条件较清楚,覆盖 panoptic、instance、semantic 任务。扣分在于缺少明确的中文使用说明和语义误触发边界,强依赖 Docker、NVIDIA GPU、TAO 容器、S3/GitHub 等环境;海外依赖可能降低中国大陆网络可达性。
SKILL.md 结构较完整,包含元数据、版本、作者、参数、模板、错误模式、部署说明和许可证;仓库 README 还说明了同步维护和安装入口。扣分在于缺少 Instructions、Examples、FAQ、changelog 和明确维护责任人或更新路径,作者格式不完整,且 schemas 目录的打包约定在基准报告中被标为结构问题。
技能直接覆盖 TAO Mask2Former 的训练到部署流程,提供数据路径映射、配置模板、父模型推断和常见故障处理,理论上能减少手工配置。扣分在于没有本审查可独立验证的代表性输出,数据与模型产物仍需用户准备,模板与运行时版本差异可能导致额外修正;静态校准下不超过7分。
提供了提交版本、配置 schema 元数据、动作命令、模板和错误说明,基准文件也记录了一次单任务评估。扣分在于基准仅有一个正向任务、无负向任务,未提供可独立核验的 CI 或完整测试覆盖,且评估结果属于仓库内声明而非独立交叉证据;静态审查下不得超过5分。
- 运行前应核对 TAO 容器版本、生成的 schemas/templates、数据集格式和 COCO 类别 ID 设置;文档模板默认值并不总与正文要求一致。
- 训练和推理可能访问 S3、GitHub 预训练权重及 W&B;不要提供未经授权的敏感数据或凭据,并确认网络、数据驻留和外部上传策略。
- 建议在隔离环境中先进行小规模验证,并保留检查点和输出目录以便人工恢复。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用 NVIDIA TAO Mask2Former 的通用图像分割流程,覆盖全景、实例和语义分割。它指导模型训练、评估、推理、ONNX 导出、量化以及 TensorRT 部署相关操作。技能包含数据集要求、规格覆盖参数、AutoML 训练策略、多 GPU 配置、导出限制和常见错误处理。运行需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU;模型分割任务内存占用较高。
读取技能内的部署参考、生成的 TAO schema、规格模板和 AutoML 配置;根据动作要求构造 COCO 或 COCO panoptic 数据源路径,并指导 train、evaluate、inference、export、quantize 和 TensorRT 部署流程。它说明检查点、ONNX 文件、TensorRT 引擎和结果目录等参数如何从父作业或当前作业推断,并给出 Swin 主干预训练权重、类别数、分割模式、GPU 数量和数据路径的配置方式。
- 计算机视觉工程师需要用 COCO panoptic 数据训练全景分割模型时,使用该技能配置数据源、类别数、训练周期和 GPU。
- 模型评估人员需要对已训练的 Mask2Former 检查点执行验证时,使用该技能准备评估数据和检查点参数。
- 部署工程师需要将 Mask2Former 导出为 ONNX 并生成 TensorRT 引擎时,使用该技能遵循部署参考和默认导出尺寸。
- 团队需要运行语义、实例或全景分割推理时,使用该技能选择 model.mode 并配置对应数据文件。
- GPU 资源有限或遇到 CUDA 内存不足时,使用该技能调整图像分辨率或选择更小的 Swin 变体。
这个 Skill 有哪些优点和局限?
- 覆盖 Mask2Former 的训练、评估、推理、导出、量化和 TensorRT 部署流程。
- 明确列出 COCO panoptic 数据文件、规格键和每个动作的数据要求。
- 提供 AutoML 训练策略、检查点推断、多 GPU 配置和常见错误处理。
- 说明 TensorRT 仅支持 FP32 和 FP16,并给出可工作的默认导出尺寸。
- 依赖 Docker、nvidia-container-toolkit 和至少一块 NVIDIA GPU;推荐 4 块 GPU 和每卡 24GB 以上显存。
- Mask2Former 内存占用高,默认每 GPU batch size 为 1。
- 每个动作都要求构造数据源路径,使用者必须准备符合要求的 COCO 或 COCO panoptic 文件。
- TensorRT 不支持 INT8;小于默认导出尺寸的测试尺寸可能触发 ONNX 形状推断错误。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-train-mask2former --yes
CLI 会提示或确定安装目标;无需手动克隆仓库或复制技能目录。源材料未说明特定客户端之外的安装目录细节。
如何使用这个 Skill?
安装后,在支持 Agent Skills 的客户端中提出明确任务,例如:"训练 Mask2Former 全景分割模型"、"评估这个 Mask2Former 检查点" 或 "导出 Mask2Former ONNX 并部署 TensorRT"。处理 TensorRT 引擎生成、TensorRT evaluate 或 TensorRT inference 前,应先读取 references/tao-deploy-mask2former.md。所有训练、评估、推理和量化动作都必须提供表中要求的数据源路径。