TAO RT-DETR 目标检测
指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。
技能将工具限制为 Read 和 Bash,并明确需要 Docker、NVIDIA Container Toolkit、GPU、数据集和检查点;但未规定逐步用户确认、敏感数据处理、网络/W&B 数据流、权限隔离或回滚机制。模板默认启用 W&B,且存在 S3 路径和 encryption_key,透明度与最小权限不足,因此扣分。
文档覆盖训练、蒸馏、量化、评估、导出、推理、部署和多节点配置,并列出若干错误模式;但静态材料未提供可执行测试或关键路径复现。存在外部 AutoML/TAO Deploy 依赖、占位符 ???、模板与输入映射可能不一致等风险,按静态上限保守扣分。
目标用户、触发短语、支持动作、COCO 数据格式、GPU/显存要求和主要非适用条件较清楚;但缺少更完整的输入输出契约、版本边界和语义排除条件。核心环境依赖 Docker、NVIDIA GPU、TAO 容器及可能的云存储,未说明中国大陆网络可达性,因此扣分。
SKILL.md 结构较完整,包含数据要求、参数、模板、错误模式和推理映射;但缺少推荐的 Instructions、Examples 和 FAQ,版本仅为 0.1.0,没有技能级 changelog、维护责任和更新路径。技能声明 Apache-2.0,而仓库对文档还声明 CC-BY-4.0,许可证适用范围不够明确,因此扣分。
技能直接覆盖 RT-DETR 的主要 TAO 工作流,并提供动作模板、数据源映射、检查点传递和错误处理建议;提交的 benchmark 报告显示单个任务通过,但样本量为 1、无负向任务且未在本次静态审查中执行。输出仍依赖正确环境、外部服务和用户补全路径,故未给满分。
文件包含固定 revision 范围内的模板、skill_info、评估任务和 benchmark 报告,提供了一定审计线索;但没有覆盖关键动作的提交测试套件、CI 复现证据或多来源交叉验证,benchmark 也只有一个任务,因此静态评分受限。
- 执行前应确认 Docker、NVIDIA Container Toolkit、GPU、TAO 镜像、数据集路径和检查点来源;不要默认上传敏感数据或启用 W&B。
- 应验证 AutoML 路由、TAO Deploy 文档、模板占位符、输入映射和 RT-DETR 版本是否匹配,并为失败任务保留可恢复的输出目录。
- S3、容器镜像和外部 NVIDIA 服务的中国大陆网络可达性未在材料中证明。
这个 Skill 能做什么,适合哪些场景?
该技能面向使用 NVIDIA TAO Toolkit 进行 RT-DETR 二维目标检测的用户。它覆盖训练、评估、推理、导出、蒸馏和量化,并提供数据集、检查点、多 GPU 及 TensorRT 流程的配置规则。训练默认采用 AutoML,用户可按单次运行开启或关闭。运行环境需要 Docker 和 NVIDIA Container Toolkit。
读取技能内的配置、架构和部署参考文件,使用 TAO PyT CLI 处理 train、distill、quantize、evaluate、export 和 inference 操作;为各操作构造 COCO 或 COCO raw 数据源路径、检查点和输出路径;通过 torchrun 支持多 GPU 与多节点训练;使用 640×640 默认输入导出 ONNX,并通过 RT-DETR 部署流程生成或使用 TensorRT 引擎;根据训练结果解析 mAP50 或 val_mAP 等指标。
- 计算机视觉工程师需要用自有 COCO 格式数据训练实时二维目标检测模型时。
- 部署团队需要将已训练的 RT-DETR 模型导出为 ONNX 或 TensorRT 流程时。
- 模型优化人员需要使用教师模型进行知识蒸馏或执行量化时。
- 平台工程师需要在单 GPU、多 GPU 或多节点环境中运行 TAO RT-DETR 训练时。
这个 Skill 有哪些优点和局限?
- 覆盖 RT-DETR 从训练到部署优化的主要 TAO 操作。
- 明确规定各操作所需的数据源、检查点和关键参数。
- 支持 AutoML、知识蒸馏、量化、多 GPU 和多节点训练。
- 提供常见错误模式及检查点交接规则。
- 依赖 Docker、NVIDIA Container Toolkit 和 NVIDIA GPU 环境。
- 最低要求 1 张 GPU,推荐 2 张,并建议每张 GPU 具备 16GB 以上显存。
- 技能正文未提供独立测试报告、性能基准数值或完整部署参考文件内容。
- TensorRT 引擎生成不通过父级 PyT CLI 的 gen_trt_engine 子命令,而需使用单独部署流程。
如何安装这个 Skill?
使用 NVIDIA 技能集合的 CLI 安装:npx skills add nvidia/skills --skill tao-train-rtdetr --yes。将 Docker 与 NVIDIA Container Toolkit 配置好;README 未提供该技能独立于技能 CLI 的手动安装步骤。
如何使用这个 Skill?
安装后,让兼容的 Agent 处理例如“train RT-DETR”或“用 TAO 训练低延迟目标检测模型”的请求。提供数据集位置、类别数、GPU 设置和检查点等信息;训练阶段默认使用 AutoML,也可明确要求“disable AutoML”或设置 automl_policy: off。评估、导出、推理、蒸馏和量化应提供相应的检查点及数据源。TensorRT 操作前需读取 references/tao-deploy-rtdetr.md。
这个 Skill 与同类方案有什么区别?
技能正文将 RT-DETR 与 DINO/GDINO 作配置层面的对比:RT-DETR 默认使用 640×640 输入和 3 个特征层,通常比 DINO 的更大输入和 4 个特征层更轻量;来源没有提供统一基准结果。