开发与工程 ✓ NVIDIA · 官方 ocrscene-text-recognitiontao-toolkitctc-decoderattention-decodertensorrtmodel-quantization

TAO OCRNet 场景文字识别技能

用 NVIDIA TAO 训练并部署场景文字识别模型。

FollowSkills 评估 · FSRS-2.0
不推荐
48/ 100 五分制 2.4 / 5
信任安全13 / 25 · 2.6/5

技能声明仅允许 Read 和 Bash,并明确需要 Docker 与 NVIDIA Container Toolkit;但 Bash、GPU、输出路径及默认启用 Weights & Biases 可能产生外部影响,未说明数据流、敏感数据处理、用户确认、隔离或回滚机制,因此扣分。未见恶意行为或明显越权红线。

可靠稳定8 / 20 · 2.0/5

文档提供了动作、输入、检查点选择、数据集要求、错误模式和确定性配置,支持较完整的静态主路径;但未提供覆盖关键路径的测试或 CI,依赖版本不明确,部署引用文件和若干生成资源未在给定材料中得到完整验证,因此扣分。

适用触发10 / 15 · 3.3/5

目标用户、OCRNet 场景、触发短语、输入数据格式和多种动作较清楚;但未声明充分的非适用边界、中文使用支持或中国大陆网络环境适配,且 Docker/GPU 前提限制了环境覆盖,因此扣分。

规范维护8 / 15 · 2.7/5

具有 front matter、版本、作者、许可证、分层说明、动作表、参数示例和错误模式;但缺少明确的维护责任与更新路径、变更日志、FAQ,基准报告还指出缺少推荐的 Instructions/Examples 区段、作者格式不规范以及目录结构问题;许可证元数据同时标为 NOASSERTION,因此扣分。

有效结果6 / 15 · 2.0/5

文档覆盖数据转换、训练、评估、推理、导出、剪枝、量化、重训练及部署,并给出可直接改写的配置示例,核心任务价值明确;但静态材料未验证输出可用性,且基准仅有一个任务并显示 Codex 正确性和有效性有限,因此扣分。

证据核验3 / 10 · 1.5/5

提供了固定修订上下文、动作配置、评估任务和有限 benchmark 报告,具备一定可审计性;但只有一个评估任务、无关键路径测试套件或 CI 证据,无法进行独立复现,因此扣分。

证据充分度: 评估于 2026年7月20日 审查版本 55f18499943e
上游仓库在本次评估后已有新提交;当前评分仍对应所示审查版本,可能尚未覆盖最新改动。
使用前请注意
  • 执行前应确认是否允许 W&B 等外部记录、数据上传或网络访问,并检查输入数据和加密密钥不会进入日志或远端服务。
  • 必须核对 Docker、NVIDIA Container Toolkit、TAO/PyTorch/TensorRT 版本及缺失的 references 文件;静态材料不足以保证命令可运行。
  • 文档未明确中国大陆网络可达性和中文字符集端到端验证;应单独验证字符列表、GT 文件及 BOM 处理。
  • 训练、导出、剪枝和量化会写入模型与输出路径,执行前应确认路径、备份和恢复策略。
查看完整评分方法 →

这个 Skill 能做什么,适合哪些场景?

该技能面向 NVIDIA TAO OCRNet,用于从裁剪的文字区域图像中识别文字。它覆盖数据转换、训练、评估、推理、导出、剪枝、量化、剪枝后再训练及 TensorRT 部署流程,并支持 CTC 与注意力解码器。训练阶段默认启用 AutoML,但可按单次运行关闭。运行需要 Docker、nvidia-container-toolkit 和至少一块具有 8GB 以上显存的 NVIDIA GPU。

读取技能目录中的 schemas、spec 模板、部署参考文档和模型配置;指导用户准备裁剪文字图像、标注文件、字符列表及 LMDB 数据集;通过 TAO OCRNet 执行 dataset_convert、train、evaluate、inference、export、prune、quantize 和 retrain;根据父作业解析检查点和导出文件;为 TensorRT 引擎生成、TensorRT 评估和推理读取 tao-deploy-ocrnet.md;产出 LMDB 数据、模型检查点、ONNX 文件、剪枝后的 PTH 文件、校准缓存和 TensorRT 引擎等工件。

  1. 需要使用自有裁剪文字图像训练 OCRNet 场景文字识别模型的视觉工程师。
  2. 需要在 CTC 与注意力解码器之间选择并评估识别效果的模型开发者。
  3. 需要将训练好的 OCRNet 导出为 ONNX 并生成 TensorRT 引擎进行部署的工程团队。
  4. 需要对 OCRNet 进行剪枝、量化或基于剪枝结果再训练的模型优化人员。
  5. 需要对特定字符集进行训练、评估或推理,并管理对应字符列表的用户。

这个 Skill 有哪些优点和局限?

优点
  • 覆盖 OCRNet 从数据转换到部署的完整模型生命周期。
  • 同时支持 CTC 和注意力解码器。
  • 提供检查点选择、父作业工件解析和多种数据源要求,减少路径猜测。
  • 支持 AutoML,并允许按单次训练请求关闭。
局限
  • 明确依赖 Docker、nvidia-container-toolkit 和 NVIDIA GPU,最低显存要求为 8GB。
  • 原始图像和标注文件不能直接替代 LMDB;使用原始数据时必须先执行 dataset_convert。
  • 训练脚本面向单节点,多 GPU 通过 Lightning 管理;未提供显式 num_nodes 配置。
  • 源材料没有展示该单项技能的独立测试结果或具体性能基准。

如何安装这个 Skill?

使用 NVIDIA skills CLI 安装整个集合:npx skills add nvidia/skills。只安装此技能:npx skills add nvidia/skills --skill tao-train-ocrnet --yes。也可指定 Codex:npx skills add nvidia/skills --skill tao-train-ocrnet --agent codex --yes。安装后,在 Docker、nvidia-container-toolkit 和 NVIDIA GPU 环境中使用。

如何使用这个 Skill?

安装后向代理提出明确任务,例如“train OCRNet”或“对裁剪文字图像执行 scene text recognition inference”。训练前准备裁剪图像、gt_new.txt、character_list,并按需先分别运行 train 和 validation 的 dataset_convert;随后提供生成的 LMDB 路径及其他数据源。若执行 TensorRT gen_trt_engine、TensorRT evaluate 或 TensorRT inference,先读取 references/tao-deploy-ocrnet.md。

常见问题

这个技能是否适合没有 NVIDIA GPU 的环境?
不适合。SKILL.md 要求 Docker、nvidia-container-toolkit 和 GPU,并建议每块 GPU 至少有 8GB 显存。
训练是否必须使用 AutoML?
模型层面启用了 AutoML,默认训练路由使用 AutoML;用户可以在单次请求中选择 automl_policy: off,改用直接训练。
为什么训练前需要执行 dataset_convert?
当数据是原始图像和 gt 文件时,dataset_convert 会生成包含 data.mdb 和 lock.mdb 的 LMDB 文件夹,训练、量化和再训练需要使用这些目录。

同仓库的其他 Skills

均来自 NVIDIA/skills

数据与分析 ✓ NVIDIA · 官方

TAO RT-DETR 目标检测

指导使用 NVIDIA TAO 训练并部署实时 RT-DETR 检测模型。

数据与分析 ✓ NVIDIA · 官方

OCDNet 场景文本检测

用 TAO Toolkit 训练和部署任意方向场景文本检测模型。

开发与工程 ✓ NVIDIA · 官方

TAO Sparse4D 训练技能

帮助代理训练、评估、导出、量化和推理多摄像头时序3D检测跟踪模型。

数据与分析 ✓ NVIDIA · 官方

TAO 度量学习识别

为细粒度视觉识别训练可用于检索匹配的图像嵌入模型。

数据与分析 ✓ NVIDIA · 官方

TAO PyT 图像分类

用 NVIDIA TAO 训练、评估并部署 PyTorch 图像分类模型。

数据与分析 ✓ NVIDIA · 官方

TAO FastFoundationStereo 实时立体深度

指导 TAO 使用 FastFoundationStereo 从双目图像生成低延迟视差图。

数据与分析 ✓ NVIDIA · 官方

TAO FoundationStereo 立体深度

使用 FoundationStereo 从双目图像生成视差图,支持三维重建模型的训练、评估与部署。

数据与分析 ✓ NVIDIA · 官方

TAO PointPillars 三维检测技能

帮助智能体训练、评估和部署基于激光雷达的 PointPillars 三维检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO CenterPose 姿态估计技能

帮助代理训练、评估、导出和部署用于6自由度物体姿态估计的CenterPose模型。

数据与分析 ✓ NVIDIA · 官方

TAO 光学缺陷检测训练

用孪生网络训练和部署制造业缺陷检测模型。

数据与分析 ✓ NVIDIA · 官方

TAO NVDINOv2 视觉表征训练

用无标签自蒸馏训练可复用的视觉特征骨干。

数据与分析 ✓ NVIDIA · 官方

TAO DINO 目标检测

指导使用 NVIDIA TAO 训练、评估和部署 DINO 目标检测器。

数据与分析 ✓ NVIDIA · 官方

TAO 标准训练流程

为 TAO 模型执行标准的训练、评估与导出流程。

数据与分析 ✓ NVIDIA · 官方

TAO 姿态分类

用 ST-GCN 将姿态关键点序列分类为动作类别。

数据与分析 ✓ NVIDIA · 官方

TAO NVPanoptix3D 三维全景重建

训练和运行基于 RGB 图像的三维全景分割与占用补全模型。

数据与分析 ✓ NVIDIA · 官方

TAO 人员重识别训练技能

训练和部署用于跨摄像头人员匹配的 TAO ReID 模型。

开发与工程 ✓ NVIDIA · 官方

TAO 技能库能力发现

通过打包的清单快速查询 TAO Skill Bank 支持的工作流、模型、平台和 AutoML 能力。

数据与分析 ✓ NVIDIA · 官方

TAO 视频动作识别训练

用 NVIDIA TAO 训练、评估、导出并推理 RGB、光流或多流视频动作识别模型。

自动化与运维 ✓ NVIDIA · 官方

TAO 工作流启动门禁

在执行 TAO 作业前完成平台、凭证、数据与容器预检。

数据与分析 ✓ NVIDIA · 官方

TAO Grounding DINO 开放词汇检测

用文本提示训练和部署无需固定类别词表的目标检测模型。

相关 Skills