Skip to main content
QUICK REVIEW

[论文解读] MMOCR: A Comprehensive Toolbox for Text Detection, Recognition and Understanding

Zhanghui Kuang, Hongbin Sun|arXiv (Cornell University)|Aug 14, 2021
Handwritten Text Recognition Techniques参考文献 43被引用 15
一句话总结

MMOCR 是一个开源、全面的深度学习工具箱,将最先进的文本检测、识别和理解方法——包括关键信息抽取和命名实体识别——统一在一个框架中。它实现了14种SOTA算法,提供广泛的预训练模型、基准测试和部署工具,显著提升了OCR研究中的可复现性与工业应用水平。

ABSTRACT

We present MMOCR-an open-source toolbox which provides a comprehensive pipeline for text detection and recognition, as well as their downstream tasks such as named entity recognition and key information extraction. MMOCR implements 14 state-of-the-art algorithms, which is significantly more than all the existing open-source OCR projects we are aware of to date. To facilitate future research and industrial applications of text recognition-related problems, we also provide a large number of trained models and detailed benchmarks to give insights into the performance of text detection, recognition and understanding. MMOCR is publicly released at https://github.com/open-mmlab/mmocr.

研究动机与目标

  • 为解决OCR工具箱的碎片化问题,通过一个可扩展的统一框架,整合多样化的文本检测、识别与理解方法。
  • 实现不同模型间关键组件(如主干网络、颈部结构)的公平比较与模块化实验。
  • 通过ONNX转换、轻量化模型和多平台推理工具,支持实际部署与工业应用。
  • 在标准数据集和工业数据集上提供全面的基准测试与预训练模型,包括多语言支持。
  • 通过提供一站式端到端OCR流水线解决方案,简化文档AI领域的研究与开发。

提出的方法

  • MMOCR 实现了14种最先进算法,包括7种文本检测(如DB、PANet、FCENet)、5种文本识别(如CRNN、SAR、RobustScanner)、1种关键信息抽取(SDMG-R)和1种命名实体识别(Bert-Softmax)方法。
  • 该工具箱基于MMDetection和MMRazor构建模块化、统一的框架,支持主干网络和颈部结构等不同组件的即插即用式集成。
  • 支持完整流水线的训练与推理,涵盖数据加载、增强和评估,配有详尽的文档与教程。
  • MMOCR 提供GPU友好的轻量化模型,如ddrnet23-slim,适用于资源受限环境下的高效推理。
  • 框架支持将模型转换为ONNX格式,便于在多种硬件平台上部署,显著提升工业可用性。
  • 工具箱包含用于可视化、演示推理和多数据集基准测试的实用工具,涵盖ICDAR、SynthText和IIT-AR-2015等数据集。

实验结果

研究问题

  • RQ1统一的模块化框架在多大程度上能提升文本检测与识别模型的可复现性与可比性?
  • RQ2在文本检测模型中,不同主干网络与颈部结构架构在性能与效率之间存在何种权衡?
  • RQ3单一工具箱在多大程度上能支持从检测到结构化信息抽取的端到端OCR流水线?
  • RQ4多语言与工业规模的预训练模型的引入,如何提升真实场景下OCR的部署效果?
  • RQ5轻量化架构如ddrnet23-slim对文本检测任务的推理速度与准确率有何影响?

主要发现

  • MMOCR 实现了14种最先进算法,在支持方法的广度与深度上均超越了现有的开源OCR工具箱。
  • ddrnet23-slim 主干网络在文本检测任务中,FLOPs分别仅为ResNet18和ResNet50的45%和21%,且H-mean性能仅略有下降。
  • 在基于PAN的模型中,FPEM_FFM(来自PAN)在FLOPs最低的前提下实现了最佳H-mean;而FPNF(来自PSENet)虽达到最高H-mean,但FLOPs显著更高。
  • FPNF颈部结构的FLOPs远高于PFNC(来自DB)和FPEM_FFM,表明其在准确率与效率之间存在明显权衡。
  • MMOCR 在公开与工业数据集上提供了丰富的预训练模型,包括中文文本识别模型,显著增强了多语言OCR支持能力。
  • 该工具箱支持无缝的ONNX导出,便于在多种硬件平台部署,这对工业应用至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。