TAO OneFormer 通用分割技能
用单一任务条件化模型训练并部署全景、实例和语义图像分割。
技能声明仅使用 Read 和 Bash,并明确依赖 Docker、NVIDIA Container Toolkit、GPU、S3 数据路径及预训练权重下载;未见恶意行为、凭据窃取或隐蔽外传,但缺少最小权限细化、用户确认、敏感数据处理、网络依赖审计和回滚方案,因此扣分。
文档提供了动作映射、数据要求、检查点选择规则、确定性配置和多项错误模式,支持较好的静态可诊断性;但未执行复现,依赖版本和关键运行环境不完整,且存在默认 1 GPU 与最低 2 GPU 要求等张力,因此受静态上限限制并扣分。
目标用户、OneFormer 的训练/评估/推理/导出/量化场景和触发短语较清楚,也说明了非训练动作边界;但非适用范围、语义误触发条件、中文支持及中国大陆网络可达性没有说明,且硬件门槛较高,因此扣分。
技能包含 front matter、版本、作者、许可证、动作表、参数说明、错误模式和引用文件,结构较完整;但缺少独立的 Instructions、Examples、FAQ、变更日志和明确维护责任,许可证元数据为 NOASSERTION 与技能声明的 Apache-2.0 存在治理歧义,因此扣分。
文档覆盖从数据准备到训练、检查点评估、导出、推理和量化的核心流程,并给出可直接改写的 spec overrides;提交的单任务 benchmark 报告显示技能辅助任务通过,但没有实际模型结果或多样化任务覆盖,故仅给静态上限内的较高分。
存在结构化 schemas、skill_info、spec templates、evals.json 和 benchmark 报告,关键规则可追溯;但 benchmark 仅有 1 个任务、无提交的测试套件或 CI 复现链,也缺少独立交叉来源,因此证据覆盖有限并扣分。
- 执行前应确认 Docker、NVIDIA Container Toolkit、GPU 数量/显存、TAO 镜像和所有外部权重来源,并审查 S3 数据是否含敏感信息。
- 不要直接采用 latest 检查点或不受信任检查点;应验证解析后的具体路径,并谨慎使用 TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1。
- 应补充中文用户说明、中国大陆网络可达性、版本兼容矩阵、示例和可复现测试。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO OneFormer,用于通用图像分割工作流。它覆盖训练、评估、推理、导出、量化及 TensorRT 部署相关操作。模型以任务条件化查询统一全景、实例和语义分割。运行需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU;训练至少需要 2 张 GPU,建议使用 24GB 以上显存。
读取技能内的配置、Schema、部署说明和规格模板;根据动作要求构造训练、评估、推理和量化数据路径;通过 TAO 工作流运行 OneFormer 训练或 AutoML,解析检查点,并将其用于评估、推理、导出、量化或 TensorRT 操作。它还指导设置类别数、任务模式、精度、输出路径和多 GPU 参数,并说明常见 CUDA、路径、检查点和 ONNX 导出错误的处理方式。
- 计算机视觉团队使用 COCO 全景数据训练同时支持语义、实例和全景分割的 OneFormer 模型。
- 模型工程师需要用已选检查点执行评估,并查看总体及每类 IoU。
- 部署团队将 OneFormer 导出为 ONNX、生成 TensorRT 引擎,或运行 TensorRT 评估和推理。
- 研究人员使用 AutoML 进行训练超参数搜索,或在明确要求时关闭 AutoML 执行普通训练。
- 平台工程师在多 GPU 环境中运行 Lightning 管理的 DDP 训练并排查显存或检查点加载问题。
这个 Skill 有哪些优点和局限?
- 覆盖 OneFormer 的训练、评估、推理、导出、量化和 TensorRT 部署流程。
- 明确列出各动作的数据文件、规格覆盖项、检查点选择规则和常见失败模式。
- 支持模型级 AutoML,并允许按运行选择启用或关闭。
- 提供多 GPU、多节点 DDP 参数以及 COCO 全景数据的关键类别映射说明。
- 硬件要求高:最低 2 张 GPU,建议每张具备 24GB 以上显存,训练默认 50 个 epoch 且 batch size 为 1。
- 明确要求 Docker 和 nvidia-container-toolkit;不适合无 NVIDIA GPU 的环境。
- 技能正文没有给出完整的安装、执行命令或独立测试套件证据。
- 数据源路径、检查点路径和父 AutoML 作业目录配置不正确时,评估、量化或推理可能失败。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装:
npx skills add nvidia/skills --skill tao-train-oneformer --yes
也可以先运行 npx skills add nvidia/skills --list 查看目录。无需克隆仓库或手动复制技能目录。
如何使用这个 Skill?
安装后,向支持 Agent Skills 的代理提出类似“train OneFormer for universal segmentation”或“export this TAO OneFormer model” 的请求。处理 TensorRT 引擎生成、TensorRT 评估或 TensorRT 推理前,应读取 references/tao-deploy-oneformer.md;训练阶段应读取 references/skill_info.yaml,并根据请求决定 automl_policy。必须为每个动作提供对应的数据源路径。具体 TAO 运行命令未在该技能正文中完整记录。