数据与分析 ✓ NVIDIA · 官方 object-detectionrt-detrtao-toolkitmodel-trainingmodel-distillationmodel-quantizationtensorrtautoml

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

FollowSkills 评估 · FSRS-2.0
不推荐
47/ 100 五分制 2.4 / 5
信任安全14 / 25 · 2.8/5

技能将工具限制为 Read 和 Bash,并明确需要 Docker、NVIDIA Container Toolkit、GPU、数据集和检查点;但未规定逐步用户确认、敏感数据处理、网络/W&B 数据流、权限隔离或回滚机制。模板默认启用 W&B,且存在 S3 路径和 encryption_key,透明度与最小权限不足,因此扣分。

可靠稳定6 / 20 · 1.5/5

文档覆盖训练、蒸馏、量化、评估、导出、推理、部署和多节点配置,并列出若干错误模式;但静态材料未提供可执行测试或关键路径复现。存在外部 AutoML/TAO Deploy 依赖、占位符 ???、模板与输入映射可能不一致等风险,按静态上限保守扣分。

适用触发9 / 15 · 3.0/5

目标用户、触发短语、支持动作、COCO 数据格式、GPU/显存要求和主要非适用条件较清楚;但缺少更完整的输入输出契约、版本边界和语义排除条件。核心环境依赖 Docker、NVIDIA GPU、TAO 容器及可能的云存储,未说明中国大陆网络可达性,因此扣分。

规范维护8 / 15 · 2.7/5

SKILL.md 结构较完整,包含数据要求、参数、模板、错误模式和推理映射;但缺少推荐的 Instructions、Examples 和 FAQ,版本仅为 0.1.0,没有技能级 changelog、维护责任和更新路径。技能声明 Apache-2.0,而仓库对文档还声明 CC-BY-4.0,许可证适用范围不够明确,因此扣分。

有效结果6 / 15 · 2.0/5

技能直接覆盖 RT-DETR 的主要 TAO 工作流,并提供动作模板、数据源映射、检查点传递和错误处理建议;提交的 benchmark 报告显示单个任务通过,但样本量为 1、无负向任务且未在本次静态审查中执行。输出仍依赖正确环境、外部服务和用户补全路径,故未给满分。

证据核验4 / 10 · 2.0/5

文件包含固定 revision 范围内的模板、skill_info、评估任务和 benchmark 报告,提供了一定审计线索;但没有覆盖关键动作的提交测试套件、CI 复现证据或多来源交叉验证,benchmark 也只有一个任务,因此静态评分受限。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应确认 Docker、NVIDIA Container Toolkit、GPU、TAO 镜像、数据集路径和检查点来源;不要默认上传敏感数据或启用 W&B。
  • 应验证 AutoML 路由、TAO Deploy 文档、模板占位符、输入映射和 RT-DETR 版本是否匹配,并为失败任务保留可恢复的输出目录。
  • S3、容器镜像和外部 NVIDIA 服务的中国大陆网络可达性未在材料中证明。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向使用 NVIDIA TAO Toolkit 进行 RT-DETR 二维目标检测的用户。它覆盖训练、评估、推理、导出、蒸馏和量化,并提供数据集、检查点、多 GPU 及 TensorRT 流程的配置规则。训练默认采用 AutoML,用户可按单次运行开启或关闭。运行环境需要 Docker 和 NVIDIA Container Toolkit。

读取技能内的配置、架构和部署参考文件,使用 TAO PyT CLI 处理 train、distill、quantize、evaluate、export 和 inference 操作;为各操作构造 COCO 或 COCO raw 数据源路径、检查点和输出路径;通过 torchrun 支持多 GPU 与多节点训练;使用 640×640 默认输入导出 ONNX,并通过 RT-DETR 部署流程生成或使用 TensorRT 引擎;根据训练结果解析 mAP50 或 val_mAP 等指标。

  1. 计算机视觉工程师需要用自有 COCO 格式数据训练实时二维目标检测模型时。
  2. 部署团队需要将已训练的 RT-DETR 模型导出为 ONNX 或 TensorRT 流程时。
  3. 模型优化人员需要使用教师模型进行知识蒸馏或执行量化时。
  4. 平台工程师需要在单 GPU、多 GPU 或多节点环境中运行 TAO RT-DETR 训练时。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 RT-DETR 从训练到部署优化的主要 TAO 操作。
  • 明确规定各操作所需的数据源、检查点和关键参数。
  • 支持 AutoML、知识蒸馏、量化、多 GPU 和多节点训练。
  • 提供常见错误模式及检查点交接规则。
局限
  • 依赖 Docker、NVIDIA Container Toolkit 和 NVIDIA GPU 环境。
  • 最低要求 1 张 GPU,推荐 2 张,并建议每张 GPU 具备 16GB 以上显存。
  • 技能正文未提供独立测试报告、性能基准数值或完整部署参考文件内容。
  • TensorRT 引擎生成不通过父级 PyT CLI 的 gen_trt_engine 子命令,而需使用单独部署流程。

如何安装这个 Skill?

使用 NVIDIA 技能集合的 CLI 安装:npx skills add nvidia/skills --skill tao-train-rtdetr --yes。将 Docker 与 NVIDIA Container Toolkit 配置好;README 未提供该技能独立于技能 CLI 的手动安装步骤。

如何使用这个 Skill?

安装后,让兼容的 Agent 处理例如“train RT-DETR”或“用 TAO 训练低延迟目标检测模型”的请求。提供数据集位置、类别数、GPU 设置和检查点等信息;训练阶段默认使用 AutoML,也可明确要求“disable AutoML”或设置 automl_policy: off。评估、导出、推理、蒸馏和量化应提供相应的检查点及数据源。TensorRT 操作前需读取 references/tao-deploy-rtdetr.md。

这个 Skill 与同类方案有什么区别?

技能正文将 RT-DETR 与 DINO/GDINO 作配置层面的对比:RT-DETR 默认使用 640×640 输入和 3 个特征层,通常比 DINO 的更大输入和 4 个特征层更轻量;来源没有提供统一基准结果。

常见问题

是否必须使用 NVIDIA GPU?
是。技能要求 Docker 和 NVIDIA Container Toolkit,并注明最低 1 张 GPU、推荐 2 张 GPU;建议每张 GPU 具备 16GB 以上显存。
训练时 AutoML 能否关闭?
可以。默认开启,但可在本次运行中明确要求关闭,例如使用 automl_policy: off、“disable AutoML”或“plain training”。
哪些数据格式受支持?
数据集类型为 object_detection,支持 coco 和 coco_raw;不同操作需要不同的数据源字段和文件。
为什么 TensorRT 生成命令可能失败?
父级 PyT CLI 不公开 gen_trt_engine;应使用 models/rtdetr/deploy 及 references/tao-deploy-rtdetr.md 中的部署流程。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

开发与工程 ✓ NVIDIA · 官方

TAO OCRNet 场景文字识别技能

用 NVIDIA TAO 训练并部署场景文字识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

开发与工程 ✓ NVIDIA · 官方

TAO 技能库能力发现

通过打包的清单快速查询 TAO Skill Bank 支持的工作流、模型、平台和 AutoML 能力。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO OneFormer 通用分割技能

用单一任务条件化模型训练并部署全景、实例和语义图像分割。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO SegFormer 语义分割技能

为 TAO SegFormer 提供语义分割训练、评估与部署指导。

数据与分析 ✓ NVIDIA · 官方

Mask Grounding DINO 训练与部署技能

用文本提示训练、评估并部署开放词汇实例分割模型。

数据与分析 ✓ NVIDIA · 官方

TAO MAL 弱监督分割

用点或框标注训练模型,生成弱监督语义分割掩码。

相关 Skills