TAO Deformable DETR 目标检测
帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。
文档声明仅需 Read 和 Bash,并说明了容器、数据源、检查点和加密键映射;但未要求执行前用户确认,未充分披露 S3、WandB、Docker/容器及模型数据的数据流,也未提供回滚或敏感数据处理规则。未见红线风险,但权限隔离和外部副作用控制不完整,因此扣分。
文档覆盖动作、参数、架构一致性、确定性训练设置和常见错误;但源材料未包含所引用的 schemas 目录内容,skill_info.yaml 与文档对 export 输入存在不一致,模板含有 ??? 未解析值,且没有覆盖关键路径的专属测试。静态评估上限为 10,故仅给 8 分。
目标用户、触发短语、训练/评估/导出/量化/推理场景和 TensorRT 非适用边界较清楚,也说明了 GPU、Docker 和多节点要求;但未声明非目标场景、中文交互支持或中国大陆网络可达性,S3、WandB 和容器获取路径可能造成环境限制,因此扣分。
前置元数据包含名称、Apache-2.0 许可、版本和作者,README 说明 NVIDIA 官方来源、每日同步和更新方式;但缺少独立 Instructions、Examples、FAQ、变更日志和完整维护责任,作者格式不符合报告中的规范检查,且仓库 NOASSERTION 许可元数据与技能声明存在不确定性,因此扣分。
技能对数据集字段、检查点传递、AutoML 路由、导出和部署提供了较直接的操作指导,核心任务具备可执行性;但关键依赖和模板完整性未在本材料中得到充分证明,基准仅含 1 个任务且 Codex 正确性和有效性结果有限。静态评估上限为 7,故给 5 分。
存在 skill_info.yaml、多个配置模板、评估任务和提交的基准报告,可进行有限追溯;但只有单个正向任务、无负向触发覆盖、无该技能专属测试套件,也没有多来源或独立复现证据。静态评估上限为 5,故给 4 分。
- 执行训练、AutoML、导出或部署前,应确认 Docker/NVIDIA 容器、GPU、数据路径、WandB/S3 访问和凭据范围,并避免将敏感数据写入日志或外部服务。
- 先核对 schemas/<action>.schema.json、模板和 skill_info.yaml 是否实际随包提供且一致;不要直接使用含 ??? 的模板。
- 检查 export、evaluate、inference、quantize 与训练使用的架构参数和精确检查点路径,避免形状不匹配或评估错误。
- 基准仅覆盖一个正向计划任务,不能证明真实训练、部署成功率或中国大陆网络环境下的可用性。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO Toolkit 中的 Deformable DETR 二维目标检测工作流,使用可变形注意力处理多尺度特征。它覆盖训练、评估、推理、导出和量化,并说明如何使用 TAO Deploy 生成 TensorRT 引擎。技能提供数据集格式、数据源路径、检查点、关键模型参数、多 GPU 运行和常见错误的操作规则。它适合已经具备 Docker、nvidia-container-toolkit 和 NVIDIA GPU 环境的用户。
读取技能内的 TAO 配置、生成的 action schema 和部署模板;指导代理为 COCO 或 COCO raw 数据集构造训练、评估、导出、推理和量化所需的 spec_overrides;运行 TAO 模型或 AutoML 训练流程;处理精确检查点路径;将模型导出为 ONNX,并使用 TAO Deploy 模板生成 FP32、FP16 或 INT8 TensorRT 引擎;根据验证指标和错误模式指导参数调整。
- 计算机视觉工程师希望用自定义 COCO 数据集训练 Deformable DETR 时,使用该技能配置类别、数据源、检查点和训练参数。
- 模型开发者需要评估训练结果并按 AP50 或 COCO 风格 mAP 选择指标时,使用该技能建立评估流程。
- 部署工程师需要把已训练模型导出为 ONNX 并生成 TensorRT 引擎时,使用该技能选择正确的 TAO Deploy 容器和模板。
- 研究人员需要通过 AutoML 搜索训练参数,或在单次实验中关闭 AutoML 进行普通训练时,使用该技能管理每次运行的策略。
- GPU 平台工程师需要在单机或多节点环境中配置 Lightning 管理的 DDP/FSDP 训练时,使用该技能核对 GPU 和分布式环境设置。
这个 Skill 有哪些优点和局限?
- 覆盖从训练到 TensorRT 部署的完整 Deformable DETR 工作流。
- 明确列出各 action 的数据集文件、路径键和必需的数据源覆盖项。
- 包含 AutoML 路由、检查点选择、架构参数传递、多 GPU 设置和常见故障处理。
- 技能版本为 0.1.0,作者标注为 NVIDIA Corporation,技能许可证为 Apache-2.0。
- 要求 Docker、nvidia-container-toolkit、NVIDIA GPU,以及至少 1 张 GPU;推荐 4 张、每张 16GB 以上显存。
- 仅支持 object_detection 数据集及 coco、coco_raw 格式,不能据此推断支持其他任务。
- PyT 模型容器不支持原生 gen_trt_engine,TensorRT 引擎生成必须使用 TAO Deploy 容器。
- 源材料没有提供独立测试套件、性能基准数值或具体 TAO/容器版本信息。
如何安装这个 Skill?
使用仓库 README 支持的 skills CLI 安装指定技能:
npx skills add nvidia/skills --skill tao-train-deformable-detr --yes
README 未说明该技能的单独源码安装流程;运行环境还需要 Docker、nvidia-container-toolkit 和 NVIDIA GPU。
如何使用这个 Skill?
安装后,在加载该技能的代理中提出明确任务,例如:"train deformable-detr on my COCO dataset"、"evaluate my TAO Deformable DETR checkpoint" 或 "export and quantize a Deformable DETR model"。为每个 action 提供对应的数据源路径;训练阶段默认启用 AutoML,也可在请求中指定关闭 AutoML。生成 TensorRT 引擎时,先完成 export,再使用 TAO Deploy 容器和部署模板。
这个 Skill 与同类方案有什么区别?
技能明确将 Deformable DETR 与 DINO 作对比:它使用更小的 FFN,通常更轻,但支持的 backbone 更有限;其默认 dropout_ratio 为 0.3、dim_feedforward 为 1024,而文档中列出的 DINO 对应值分别为 0.0 和 2048。除此之外,源材料没有提供与其他产品的完整对比。