OCDNet 场景文本检测
用 TAO Toolkit 训练和部署任意方向场景文本检测模型。
声明仅允许 Read 和 Bash,并明确数据路径、检查点交接和输出目录,体现了一定的权限与数据流约束;但未要求执行前用户确认,未说明敏感数据处理、网络/容器边界、回滚或失败恢复,因此扣10分。
文档覆盖训练、评估、推理、导出、剪枝、量化、重训练及若干错误模式,并指出 AutoML 和检查点限制;但依赖 Docker、NVIDIA Container Toolkit、TAO 运行时,且未提供针对关键路径的可复现实测套件,静态评估按上限扣分。
名称、触发短语、输入数据格式、动作范围和多 GPU 配置较明确,适用于具有 NVIDIA GPU 的 TAO OCDNet 工作流;但未充分定义不适用场景、版本/平台边界、中文使用支持或中国大陆网络可达性,且核心容器可用性未说明,因此扣5分。
包含 front matter、Apache-2.0、版本号、作者、标签、参数表、模板引用、错误模式和检查点说明,结构总体可读;但缺少独立 Instructions、Examples、FAQ、变更记录、明确维护责任和更新路径,基准文件还记录了目录层级、推荐章节和作者格式问题,因此扣5分。
文档为 OCDNet 各动作提供了可直接映射的参数、数据路径和检查点规则,理论上能完成核心工作流;但没有静态可验证的代表性产物或结果质量证据,且完整运行依赖外部 TAO/Docker 环境,只给6分。
包含 schema/模板映射、skill_info、评估任务和基准报告,提供了一定的审计线索;但评估仅含一个任务、未提供可核验执行日志或关键路径测试,且基准报告本身不能替代独立复现,静态上限为5并再扣1分。
- 执行会通过 Bash、Docker 和 GPU/TAO 运行时产生外部计算与文件输出;应在运行前确认用户授权、数据位置、结果目录和资源消耗。
- 文档要求解压数据集并处理检查点,但未规定失败后的清理、回滚或磁盘配额策略。
- AutoML、TAO 容器、TensorRT 部署和相关依赖的版本兼容性及中国大陆网络可达性未在选定技能中得到保证。
- 基准证据只有一个正向任务且未展示执行日志,不能据此推断运行正确性或生产级效果。
这个 Skill 能做什么,适合哪些场景?
该技能指导 AI Agent 使用 NVIDIA TAO Toolkit 操作 OCDNet 场景文本检测模型。OCDNet 通过可微二值化方法检测自然图像中的任意方向文本区域。它覆盖训练、评估、推理、导出、剪枝、量化、从剪枝结果重训练,以及 TensorRT 部署流程。使用者需要 Docker、nvidia-container-toolkit 和至少一块具备 8GB 以上显存的 NVIDIA GPU。
读取技能中的部署说明、生成的 TAO Core schema 和 YAML 模板;根据具体动作构造已解压的数据集路径;运行 OCDNet 的 train、evaluate、export、inference、prune、quantize 和 default_specs 流程;通过 AutoML 路由训练任务;处理训练、评估、导出、剪枝和量化之间的检查点交接;为 TensorRT engine 生成、TensorRT evaluate 和 TensorRT inference 读取部署参考;产出模型检查点、导出的 ONNX、剪枝模型或量化模型。
- 需要在带有 img/ 和 gt/ 目录的数据集上训练 OCDNet 场景文本检测模型的 TAO 用户。
- 需要评估已训练模型或对自然图像执行任意方向文本检测推理的计算机视觉工程师。
- 需要导出 ONNX、生成 TensorRT engine 或运行 TensorRT 推理的部署工程师。
- 需要剪枝模型、从剪枝结果重训练,或使用训练检查点执行量化的模型优化人员。
- 需要通过 AutoML 搜索训练参数,并使用 hmean 或 train_loss 作为指标的实验人员。
这个 Skill 有哪些优点和局限?
- 覆盖 OCDNet 从训练到部署的完整 TAO 工作流。
- 明确规定了各动作的数据路径、检查点交接和常见失败模式。
- 支持 AutoML、单 GPU 训练、多 GPU/多节点策略,以及剪枝和量化。
- 必须使用 Docker、nvidia-container-toolkit 和 NVIDIA GPU。
- 数据集压缩包不会在运行时自动解包,使用者必须先准备正确的数据目录。
- 源材料未提供该技能的具体基准数值、运行时间或平台覆盖证据。
- PyT CLI 不提供 retrain 和 gen_trt_engine 子命令,这些操作依赖既定工作流。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装该技能:npx skills add nvidia/skills --skill tao-train-ocdnet --yes。将 Docker 和 nvidia-container-toolkit 配置在运行环境中,并准备至少一块具备 8GB 以上显存的 NVIDIA GPU。源材料未说明其他手动复制步骤。
如何使用这个 Skill?
安装后向 Agent 提出具体任务,例如“训练 OCDNet”或“对这个 OCDNet 检查点执行场景文本检测推理”。训练前应提供已解压的训练集和验证集路径;每个数据集拆分应包含 img/ 和 gt/,或使用 UTF-8 datalist 文件。数据源路径必须通过 spec_overrides 传入,不能直接传入 tar.gz。执行 TensorRT engine 生成、TensorRT evaluate 或 TensorRT inference 前,先读取 references/tao-deploy-ocdnet.md。单 epoch 训练应将 train.lr_scheduler.args.warmup_epoch 设为 0。