TAO OCRNet 场景文字识别技能
用 NVIDIA TAO 训练并部署场景文字识别模型。
技能声明仅允许 Read 和 Bash,并明确需要 Docker 与 NVIDIA Container Toolkit;但 Bash、GPU、输出路径及默认启用 Weights & Biases 可能产生外部影响,未说明数据流、敏感数据处理、用户确认、隔离或回滚机制,因此扣分。未见恶意行为或明显越权红线。
文档提供了动作、输入、检查点选择、数据集要求、错误模式和确定性配置,支持较完整的静态主路径;但未提供覆盖关键路径的测试或 CI,依赖版本不明确,部署引用文件和若干生成资源未在给定材料中得到完整验证,因此扣分。
目标用户、OCRNet 场景、触发短语、输入数据格式和多种动作较清楚;但未声明充分的非适用边界、中文使用支持或中国大陆网络环境适配,且 Docker/GPU 前提限制了环境覆盖,因此扣分。
具有 front matter、版本、作者、许可证、分层说明、动作表、参数示例和错误模式;但缺少明确的维护责任与更新路径、变更日志、FAQ,基准报告还指出缺少推荐的 Instructions/Examples 区段、作者格式不规范以及目录结构问题;许可证元数据同时标为 NOASSERTION,因此扣分。
文档覆盖数据转换、训练、评估、推理、导出、剪枝、量化、重训练及部署,并给出可直接改写的配置示例,核心任务价值明确;但静态材料未验证输出可用性,且基准仅有一个任务并显示 Codex 正确性和有效性有限,因此扣分。
提供了固定修订上下文、动作配置、评估任务和有限 benchmark 报告,具备一定可审计性;但只有一个评估任务、无关键路径测试套件或 CI 证据,无法进行独立复现,因此扣分。
- 执行前应确认是否允许 W&B 等外部记录、数据上传或网络访问,并检查输入数据和加密密钥不会进入日志或远端服务。
- 必须核对 Docker、NVIDIA Container Toolkit、TAO/PyTorch/TensorRT 版本及缺失的 references 文件;静态材料不足以保证命令可运行。
- 文档未明确中国大陆网络可达性和中文字符集端到端验证;应单独验证字符列表、GT 文件及 BOM 处理。
- 训练、导出、剪枝和量化会写入模型与输出路径,执行前应确认路径、备份和恢复策略。
这个 Skill 能做什么,适合哪些场景?
该技能面向 NVIDIA TAO OCRNet,用于从裁剪的文字区域图像中识别文字。它覆盖数据转换、训练、评估、推理、导出、剪枝、量化、剪枝后再训练及 TensorRT 部署流程,并支持 CTC 与注意力解码器。训练阶段默认启用 AutoML,但可按单次运行关闭。运行需要 Docker、nvidia-container-toolkit 和至少一块具有 8GB 以上显存的 NVIDIA GPU。
读取技能目录中的 schemas、spec 模板、部署参考文档和模型配置;指导用户准备裁剪文字图像、标注文件、字符列表及 LMDB 数据集;通过 TAO OCRNet 执行 dataset_convert、train、evaluate、inference、export、prune、quantize 和 retrain;根据父作业解析检查点和导出文件;为 TensorRT 引擎生成、TensorRT 评估和推理读取 tao-deploy-ocrnet.md;产出 LMDB 数据、模型检查点、ONNX 文件、剪枝后的 PTH 文件、校准缓存和 TensorRT 引擎等工件。
- 需要使用自有裁剪文字图像训练 OCRNet 场景文字识别模型的视觉工程师。
- 需要在 CTC 与注意力解码器之间选择并评估识别效果的模型开发者。
- 需要将训练好的 OCRNet 导出为 ONNX 并生成 TensorRT 引擎进行部署的工程团队。
- 需要对 OCRNet 进行剪枝、量化或基于剪枝结果再训练的模型优化人员。
- 需要对特定字符集进行训练、评估或推理,并管理对应字符列表的用户。
这个 Skill 有哪些优点和局限?
- 覆盖 OCRNet 从数据转换到部署的完整模型生命周期。
- 同时支持 CTC 和注意力解码器。
- 提供检查点选择、父作业工件解析和多种数据源要求,减少路径猜测。
- 支持 AutoML,并允许按单次训练请求关闭。
- 明确依赖 Docker、nvidia-container-toolkit 和 NVIDIA GPU,最低显存要求为 8GB。
- 原始图像和标注文件不能直接替代 LMDB;使用原始数据时必须先执行 dataset_convert。
- 训练脚本面向单节点,多 GPU 通过 Lightning 管理;未提供显式 num_nodes 配置。
- 源材料没有展示该单项技能的独立测试结果或具体性能基准。
如何安装这个 Skill?
使用 NVIDIA skills CLI 安装整个集合:npx skills add nvidia/skills。只安装此技能:npx skills add nvidia/skills --skill tao-train-ocrnet --yes。也可指定 Codex:npx skills add nvidia/skills --skill tao-train-ocrnet --agent codex --yes。安装后,在 Docker、nvidia-container-toolkit 和 NVIDIA GPU 环境中使用。
如何使用这个 Skill?
安装后向代理提出明确任务,例如“train OCRNet”或“对裁剪文字图像执行 scene text recognition inference”。训练前准备裁剪图像、gt_new.txt、character_list,并按需先分别运行 train 和 validation 的 dataset_convert;随后提供生成的 LMDB 路径及其他数据源。若执行 TensorRT gen_trt_engine、TensorRT evaluate 或 TensorRT inference,先读取 references/tao-deploy-ocrnet.md。