数据与分析 ✓ NVIDIA · 官方 semantic-segmentationsegformernvidia-taopytorchautomltensorrtdocker

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

FollowSkills 评估 · FSRS-2.0
不推荐
52/ 100 五分制 2.6 / 5
信任安全17 / 25 · 3.4/5

技能明确限定为 Read 和 Bash,并要求使用 Docker/NVIDIA 容器;未见恶意行为、凭据窃取或隐蔽外传指令。但训练、上传、W&B(模板默认 enable: true)及 TensorRT 流程可能产生外部或持久化影响,缺少用户确认、敏感数据处理、最小权限说明和回滚方案,因此扣分。

可靠稳定8 / 20 · 2.0/5

文档提供了动作、数据目录、参数映射、检查点选择和常见错误处理,快乐路径较清晰。静态材料未包含覆盖关键路径的测试或可复现运行日志,且依赖版本、镜像可用性和异常反馈仍不充分;按静态上限,扣分并限制在10分以内。

适用触发8 / 15 · 2.7/5

目标场景、支持动作、数据格式、GPU要求和若干非适用边界较明确。未明确语义触发排除条件、输入输出契约、中文支持或中国大陆网络可达性;核心依赖Docker、NVIDIA Toolkit和TAO容器,环境适配证据有限,因此扣分。

规范维护9 / 15 · 3.0/5

目录结构和分层参考文件较完整,包含版本0.1.0、作者、许可证字段、模板、参数表、限制和错误模式。缺少SKILL.md建议的Instructions/Examples章节、变更日志、明确维护责任和更新路径;许可证元数据与仓库文档/源代码双许可证表述也存在边界不清,因此扣分。

有效结果7 / 15 · 2.3/5

技能覆盖训练、评估、导出、推理、量化和部署,并给出数据路径、规格覆盖、AutoML路由及检查点交接规则,理论上可完成核心任务。只有一个正向基准任务且静态材料未证明实际产物可直接使用,替代方案和成本收益也未比较;按静态上限给出7分并扣除验证不足。

证据核验3 / 10 · 1.5/5

存在版本化配置、动作清单、模板、参数映射和一份单任务基准报告,提供有限审计线索。基准没有可独立复现的完整测试套件或运行证据,且仅覆盖一个正向任务,无法支持更高静态分数,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 运行训练、W&B同步或部署前应明确确认数据上传、网络访问、结果目录覆盖及GPU资源影响,并关闭不需要的W&B功能。
  • 请先验证TAO容器、Docker/NVIDIA Container Toolkit、TAO版本和参考文件在目标环境可用;文档未证明中国大陆网络可达性。
  • 许可证元数据、仓库双许可证声明和技能实际内容的适用范围应由维护者进一步澄清。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 NVIDIA TAO Toolkit 进行 SegFormer 语义分割的工作流。它覆盖训练、评估、导出、推理和量化,并说明 TensorRT 部署流程。技能包含数据集目录要求、关键参数、多 GPU 配置、检查点传递和常见错误处理。它适合已有分割数据和 NVIDIA GPU、希望通过 Docker 使用 TAO 的用户。

读取技能内的 TAO 配置、生成的 schema、规格模板和部署参考;指导用户为训练、评估、导出、推理及量化构造数据源路径和 spec_overrides;通过 TAO PyT CLI 处理常规模型操作,并通过 SegFormer deploy 流程生成 TensorRT 引擎及执行 TensorRT 评估或推理;根据 AutoML 策略选择 AutoML 或直接训练;从训练结果目录解析适用的模型检查点,并应用到下游操作;依据 val_miou、数据目录、类别数、图像尺寸和显存错误信息给出处理建议。

  1. 计算机视觉工程师使用自有 UNet 格式数据训练二分类或多类 SegFormer 模型。
  2. 模型开发者需要在训练后评估模型、导出 ONNX、运行推理或执行量化。
  3. 部署工程师需要通过 SegFormer 专用部署流程生成 TensorRT 引擎并进行 TensorRT 推理。
  4. AutoML 用户希望以 val_miou 最大化为目标运行 TAO SegFormer 超参数搜索。
  5. 使用多 GPU 或多节点环境训练,并需要 Lightning 管理的分布式启动配置的团队。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 SegFormer 的训练、评估、导出、推理和量化流程。
  • 明确规定各操作的数据目录、关键 spec 字段和检查点传递方式。
  • 包含 AutoML 默认策略、val_miou 优化目标、多 GPU 配置和常见故障处理。
  • 说明父 PyT CLI 不支持 gen_trt_engine,并提供专用部署路径。
局限
  • 依赖 Docker、nvidia-container-toolkit 和至少一块 NVIDIA GPU。
  • 只明确支持 segmentation 数据类型和 UNet 格式;其他数据格式未有证据支持。
  • 训练、部署参考文件和实际容器版本的完整内容未在材料中提供。
  • 材料没有给出测试套件、支持的具体 GPU 型号清单或完整端到端命令。
  • TensorBoard 不支持 SegFormer 分割训练,必须保持关闭。

如何安装这个 Skill?

使用 NVIDIA/skills 仓库提供的 skills CLI 安装:

npx skills add nvidia/skills --skill tao-train-segformer --yes

README 未规定手动复制该技能目录的步骤;安装后,技能目录应由 CLI 放置到所选 agent 的技能位置。

如何使用这个 Skill?

安装后,在支持该技能的 agent 中提出明确任务,例如“训练 SegFormer 语义分割模型”或“导出并量化 TAO SegFormer 模型”。准备包含 images/<split> 和 masks/<split> 的已解压数据根目录,并提供所需检查点、类别数、图像尺寸和输出目录。训练请求默认使用 AutoML;如需本次关闭,可明确说“disable AutoML”或“plain training”。TensorRT 引擎生成、TensorRT 评估和 TensorRT 推理应使用技能 references/tao-deploy-segformer.md 所述的部署流程。精确的容器启动命令和完整运行示例未在提供的材料中说明。

这个 Skill 与同类方案有什么区别?

未提供与其他分割模型或工具的直接比较。材料仅表明该技能使用相对轻量、带层级特征提取的 SegFormer 架构,并支持 TAO 与 TensorRT 工作流。

常见问题

这个技能是否适合没有 NVIDIA GPU 的环境?
不适合。技能要求 Docker、nvidia-container-toolkit,并注明至少需要 1 块 GPU;推荐每块 GPU 具备 16GB 以上显存。
必须使用 AutoML 吗?
不必须。模型层面启用 AutoML,训练默认走 AutoML;用户可通过 automl_policy: off,或明确要求关闭 AutoML,改用直接训练。
数据集应如何组织?
应提供已解压的数据根目录,其中包含类似 images/train、images/val、images/test、masks/train 和 masks/val 的目录。不要把仍只含 tar.gz 文件的暂存目录作为 root_dir。
TensorRT 引擎能否直接通过 segformer gen_trt_engine 生成?
不能依赖父 PyT CLI 的该子任务。材料要求使用 SegFormer 专用部署流程处理 TensorRT 引擎生成、评估和推理。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO Mask2Former 分割技能

指导使用 NVIDIA TAO 训练和部署 Mask2Former 分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO Depth Anything v2 深度估计

使用 NVIDIA TAO 从单张 RGB 图像训练、评估、导出和推理单目深度模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAE 视觉预训练技能

指导 NVIDIA TAO 使用掩码自编码器进行视觉预训练与微调。

开发与工程 ✓ NVIDIA · 官方

TAO HuggingFace 模型集成助手

将 HuggingFace 计算机视觉模型接入 NVIDIA TAO 的训练、导出与 TensorRT 部署流程。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML + DEFT 三阶段训练管线

为 AOI 与其他 DEFT 应用串联超参数优化、数据改进和最终模型精调。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

相关 Skills