Skip to main content
QUICK REVIEW

[논문 리뷰] MMOCR: A Comprehensive Toolbox for Text Detection, Recognition and Understanding

Zhanghui Kuang, Hongbin Sun|arXiv (Cornell University)|2021. 08. 14.
Handwritten Text Recognition Techniques참고 문헌 43인용 수 15
한 줄 요약

MMOCR는 텍스트 검출, 인식, 이해(핵심 정보 추출 및 명명된 실체 인식 포함)를 위한 최신 기술을 하나의 프레임워크 안에서 통합한 오픈소스 종합 딥러닝 툴박스입니다. 14개의 SOTA 알고리즘을 구현하고, 광범위한 사전 학습 모델, 벤치마크, 배포 도구를 제공하여 OCR 연구 분야의 재현 가능성과 산업 응용을 크게 향상시킵니다.

ABSTRACT

We present MMOCR-an open-source toolbox which provides a comprehensive pipeline for text detection and recognition, as well as their downstream tasks such as named entity recognition and key information extraction. MMOCR implements 14 state-of-the-art algorithms, which is significantly more than all the existing open-source OCR projects we are aware of to date. To facilitate future research and industrial applications of text recognition-related problems, we also provide a large number of trained models and detailed benchmarks to give insights into the performance of text detection, recognition and understanding. MMOCR is publicly released at https://github.com/open-mmlab/mmocr.

연구 동기 및 목표

  • 다양한 텍스트 검출, 인식, 이해 방법을 하나의 확장 가능한 프레임워크로 통합하여 OCR 툴박스의 분산된 환경을 해결하기 위해.
  • 다양한 모델 간의 핵심 구성 요소(예: 백본, 넥)에 대한 공정한 비교와 모듈러한 실험을 가능하게 하기 위해.
  • ONNX 변환, 경량 모델, 다중 플랫폼 추론 도구를 통해 실질적인 배포와 산업적 활용을 지원하기 위해.
  • 표준 및 산업용 데이터셋(다국어 지원 포함)에 대한 포괄적인 벤치마크와 사전 학습 모델을 제공하기 위해.
  • 엔드 투 엔드 OCR 파이프라인을 위한 통합 솔루션을 제공함으로써 문서 AI 분야의 연구 및 개발을 간소화하기 위해.

제안 방법

  • MMOCR는 7개의 텍스트 검출(예: DB, PANet, FCENet), 5개의 텍스트 인식(예: CRNN, SAR, RobustScanner), 1개의 핵심 정보 추출(SDGM-R), 1개의 명명된 실체 인식(Bert-Softmax) 알고리즘 포함 총 14개의 최신 기술을 구현합니다.
  • 툴박스는 MMDetection와 MMRazor 기반의 모듈러하고 통합된 프레임워크를 사용하여 백본 및 넥과 같은 다양한 구성 요소를 즉시 통합할 수 있도록 합니다.
  • 데이터 로딩, 증강, 평가를 포함한 전체 파이프라인 지원 기능을 통해 훈련 및 추론을 가능하게 하며, 상세한 문서와 튜토리얼도 제공합니다.
  • 자원 제약 환경에서 효율적인 추론을 위해 GPU 우수성 경량 모델인 ddrnet23-slim을 제공합니다.
  • 다양한 하드웨어 플랫폼에서의 배포를 가능하게 하기 위해 ONNX로의 모델 변환을 지원함으로써 산업적 활용도를 높입니다.
  • ICDAR, SynthText, IIT-AR-2015 등을 포함한 다수의 데이터셋에서의 시각화, 데모 추론, 벤치마크를 위한 유틸리티 도구를 포함합니다.

실험 결과

연구 질문

  • RQ1통합적이고 모듈러한 프레임워크는 텍스트 검출 및 인식 모델의 재현 가능성과 비교 가능성에 어떻게 기여할 수 있는가?
  • RQ2텍스트 검출 모델에서 다양한 백본 및 넥 아키텍처 간의 성능 및 효율성 간 상호 보완적 특성은 어떠한가?
  • RQ3한 개의 툴박스가 검출에서 구조화된 정보 추출에 이르기까지 엔드 투 엔드 OCR 파이프라인을 얼마나 잘 지원할 수 있는가?
  • RQ4다국어 및 산업 규모의 사전 학습 모델이 실제 세계의 OCR 배포에 어떤 영향을 미치는가?
  • RQ5ddrnet23-slim과 같은 경량 아키텍처는 텍스트 검출에서 추론 속도와 정확도에 어떤 영향을 미치는가?

주요 결과

  • MMOCR는 기존 오픈소스 OCR 툴박스보다 지원하는 방법의 다양성과 깊이에서 뛰어나 14개의 최신 기술 알고리즘을 구현합니다.
  • ddrnet23-slim 백본은 ResNet18과 ResNet50의 FLOPs를 각각 45%와 21% 수준으로 줄였으며, 텍스트 검출 작업에서 H-mean 성능은 약간 감소할 뿐입니다.
  • 넥 아키텍처 중에서는 PAN 기반 모델에서 FPEM_FFM(=PAN에서 유래)가 가장 낮은 FLOPs로 가장 높은 H-mean 성능을 달성했고, PSENet 기반 모델에서 FPNF가 가장 높은 H-mean 성능을 보였지만 FLOPs가 상당히 높았습니다.
  • FPNF 넥의 FLOPs는 DB에서 유래한 PFNC와 FPEM_FFM보다 상당히 높아 정확도와 효율성 사이의 상충 관계를 보여줍니다.
  • MMOCR는 공개 및 산업용 데이터셋에 대해 광범위한 사전 학습 모델을 제공하며, 중국어 텍스트 인식 모델 포함 다국어 OCR 지원을 강화합니다.
  • 툴박스는 원활한 ONNX 내보내기를 지원하여 다양한 하드웨어 플랫폼에서의 배포를 가능하게 하며, 이는 산업 응용에 있어 핵심적입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.