数据与分析 ✓ NVIDIA · 官方 scene-text-detectionocdnettao-toolkitmodel-trainingobject-detectiontensorRT

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

FollowSkills 评估 · FSRS-2.0
不推荐
53/ 100 五分制 2.7 / 5
信任安全15 / 25 · 3.0/5

声明仅允许 Read 和 Bash,并明确数据路径、检查点交接和输出目录,体现了一定的权限与数据流约束;但未要求执行前用户确认,未说明敏感数据处理、网络/容器边界、回滚或失败恢复,因此扣10分。

可靠稳定8 / 20 · 2.0/5

文档覆盖训练、评估、推理、导出、剪枝、量化、重训练及若干错误模式,并指出 AutoML 和检查点限制;但依赖 Docker、NVIDIA Container Toolkit、TAO 运行时,且未提供针对关键路径的可复现实测套件,静态评估按上限扣分。

适用触发10 / 15 · 3.3/5

名称、触发短语、输入数据格式、动作范围和多 GPU 配置较明确,适用于具有 NVIDIA GPU 的 TAO OCDNet 工作流;但未充分定义不适用场景、版本/平台边界、中文使用支持或中国大陆网络可达性,且核心容器可用性未说明,因此扣5分。

规范维护10 / 15 · 3.3/5

包含 front matter、Apache-2.0、版本号、作者、标签、参数表、模板引用、错误模式和检查点说明,结构总体可读;但缺少独立 Instructions、Examples、FAQ、变更记录、明确维护责任和更新路径,基准文件还记录了目录层级、推荐章节和作者格式问题,因此扣5分。

有效结果6 / 15 · 2.0/5

文档为 OCDNet 各动作提供了可直接映射的参数、数据路径和检查点规则,理论上能完成核心工作流;但没有静态可验证的代表性产物或结果质量证据,且完整运行依赖外部 TAO/Docker 环境,只给6分。

证据核验4 / 10 · 2.0/5

包含 schema/模板映射、skill_info、评估任务和基准报告,提供了一定的审计线索;但评估仅含一个任务、未提供可核验执行日志或关键路径测试,且基准报告本身不能替代独立复现,静态上限为5并再扣1分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行会通过 Bash、Docker 和 GPU/TAO 运行时产生外部计算与文件输出;应在运行前确认用户授权、数据位置、结果目录和资源消耗。
  • 文档要求解压数据集并处理检查点,但未规定失败后的清理、回滚或磁盘配额策略。
  • AutoML、TAO 容器、TensorRT 部署和相关依赖的版本兼容性及中国大陆网络可达性未在选定技能中得到保证。
  • 基准证据只有一个正向任务且未展示执行日志,不能据此推断运行正确性或生产级效果。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能指导 AI Agent 使用 NVIDIA TAO Toolkit 操作 OCDNet 场景文本检测模型。OCDNet 通过可微二值化方法检测自然图像中的任意方向文本区域。它覆盖训练、评估、推理、导出、剪枝、量化、从剪枝结果重训练,以及 TensorRT 部署流程。使用者需要 Docker、nvidia-container-toolkit 和至少一块具备 8GB 以上显存的 NVIDIA GPU。

读取技能中的部署说明、生成的 TAO Core schema 和 YAML 模板;根据具体动作构造已解压的数据集路径;运行 OCDNet 的 train、evaluate、export、inference、prune、quantize 和 default_specs 流程;通过 AutoML 路由训练任务;处理训练、评估、导出、剪枝和量化之间的检查点交接;为 TensorRT engine 生成、TensorRT evaluate 和 TensorRT inference 读取部署参考;产出模型检查点、导出的 ONNX、剪枝模型或量化模型。

  1. 需要在带有 img/ 和 gt/ 目录的数据集上训练 OCDNet 场景文本检测模型的 TAO 用户。
  2. 需要评估已训练模型或对自然图像执行任意方向文本检测推理的计算机视觉工程师。
  3. 需要导出 ONNX、生成 TensorRT engine 或运行 TensorRT 推理的部署工程师。
  4. 需要剪枝模型、从剪枝结果重训练,或使用训练检查点执行量化的模型优化人员。
  5. 需要通过 AutoML 搜索训练参数,并使用 hmean 或 train_loss 作为指标的实验人员。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 OCDNet 从训练到部署的完整 TAO 工作流。
  • 明确规定了各动作的数据路径、检查点交接和常见失败模式。
  • 支持 AutoML、单 GPU 训练、多 GPU/多节点策略,以及剪枝和量化。
局限
  • 必须使用 Docker、nvidia-container-toolkit 和 NVIDIA GPU。
  • 数据集压缩包不会在运行时自动解包,使用者必须先准备正确的数据目录。
  • 源材料未提供该技能的具体基准数值、运行时间或平台覆盖证据。
  • PyT CLI 不提供 retrain 和 gen_trt_engine 子命令,这些操作依赖既定工作流。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装该技能:npx skills add nvidia/skills --skill tao-train-ocdnet --yes。将 Docker 和 nvidia-container-toolkit 配置在运行环境中,并准备至少一块具备 8GB 以上显存的 NVIDIA GPU。源材料未说明其他手动复制步骤。

如何使用这个 Skill?

安装后向 Agent 提出具体任务,例如“训练 OCDNet”或“对这个 OCDNet 检查点执行场景文本检测推理”。训练前应提供已解压的训练集和验证集路径;每个数据集拆分应包含 img/ 和 gt/,或使用 UTF-8 datalist 文件。数据源路径必须通过 spec_overrides 传入,不能直接传入 tar.gz。执行 TensorRT engine 生成、TensorRT evaluate 或 TensorRT inference 前,先读取 references/tao-deploy-ocdnet.md。单 epoch 训练应将 train.lr_scheduler.args.warmup_epoch 设为 0。

常见问题

这个技能能直接处理 train.tar.gz 或 test.tar.gz 吗?
不能。必须先解压,并传入包含 img/ 和 gt/ 的拆分目录,或传入真实的 UTF-8 datalist 文件。
需要多少 GPU 资源?
最低和推荐配置都是 1 块 GPU;源材料建议每块 GPU 至少有 8GB 显存。
AutoML 是否默认启用?
该模型在模型层面启用 AutoML,训练默认使用 automl_policy: on;用户可针对单次运行选择 on 或 off。缺少训练 schema 或模板时,必须改用直接训练。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

开发与工程 ✓ NVIDIA · 官方

TAO OCRNet 场景文字识别技能

用 NVIDIA TAO 训练并部署场景文字识别模型。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO Deformable DETR 目标检测

帮助 AI 代理训练、评估、导出、量化并部署轻量级 Deformable DETR 目标检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

开发与工程 ✓ NVIDIA · 官方

NVIDIA DeepStream 开发技能

为 Python pyservicemaker 驱动的 DeepStream 视频分析流水线提供可靠开发指导。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO 度量学习识别

为细粒度视觉识别训练可用于检索匹配的图像嵌入模型。

开发与工程 ✓ NVIDIA · 官方

DeepStream 视觉模型导入助手

将目标检测模型自动接入 NVIDIA DeepStream 并生成基准报告。

数据与分析 ✓ NVIDIA · 官方

TAO NVDINOv2 视觉表征训练

用无标签自蒸馏训练可复用的视觉特征骨干。

数据与分析 ✓ NVIDIA · 官方

TAO BEVFusion 训练技能

用 TAO 训练、评估和推理融合激光雷达与摄像头数据的 BEV 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO AutoML 调参技能

为 NVIDIA TAO 网络运行可审查的自动超参数优化流程。

自动化与运维 ✓ NVIDIA · 官方

TAO Kubernetes 作业运行

通过 Kubernetes 提交和监控带 NVIDIA GPU 的 TAO 训练作业。

相关 Skills