Skip to main content
QUICK REVIEW

[논문 리뷰] PP-OCR: A Practical Ultra Lightweight OCR System

Yuning Du, Chenxia Li|arXiv (Cornell University)|2020. 09. 21.
Handwritten Text Recognition Techniques참고 문헌 23인용 수 109
한 줄 요약

PP-OCR는 중국어/영문 문자 인식(6622 글자)용 총 모델 크기 3.5M, 알파벳 숫자 기호 인식용 2.8M의 실용적인 초경량 OCR 시스템을 제시하며, slimming 및 정확도 향상 전략과 오픈 소스 pretrained 모델 세트를 특징으로 합니다.

ABSTRACT

The Optical Character Recognition (OCR) systems have been widely used in various of application scenarios, such as office automation (OA) systems, factory automations, online educations, map productions etc. However, OCR is still a challenging task due to the various of text appearances and the demand of computational efficiency. In this paper, we propose a practical ultra lightweight OCR system, i.e., PP-OCR. The overall model size of the PP-OCR is only 3.5M for recognizing 6622 Chinese characters and 2.8M for recognizing 63 alphanumeric symbols, respectively. We introduce a bag of strategies to either enhance the model ability or reduce the model size. The corresponding ablation experiments with the real data are also provided. Meanwhile, several pre-trained models for the Chinese and English recognition are released, including a text detector (97K images are used), a direction classifier (600K images are used) as well as a text recognizer (17.9M images are used). Besides, the proposed PP-OCR are also verified in several other language recognition tasks, including French, Korean, Japanese and German. All of the above mentioned models are open-sourced and the codes are available in the GitHub repository, i.e., https://github.com/PaddlePaddle/PaddleOCR.

연구 동기 및 목표

  • 자원 제약이 있는 장치와 임베드된 환경에서 효율적인 OCR의 필요성을 촉진한다.
  • 텍스트 탐지, 박스 보정, 텍스트 인식으로 구성된 초경량 OCR 파이프라인을 개발한다.
  • 크기를 줄이면서 정확도를 유지하기 위해 모델 개선 및 슬림닝 기법을 체계적으로 적용한다.
  • 오픈소스 pretrained 모델과 크기, 속도, 정확도 간의 트레이드오프를 보여주는 바이어슘 연구를 제공한다.

제안 방법

  • Differentiable Binarization(DB)을 이용한 텍스트 탐지와 경량 백본 및 헤드를 가진 세 파트 OCR 파이프라인을 채택하며; 박스 정합은 텍스트 방향 분류기를 사용하고; 텍스트 인식은 경량 백본의 CRNN을 사용한다.
  • 텍스트 탐지에 여섯 가지 전략(가벼운 백본, 가벼운 헤드, SE 제거, 코사인 LR 감소, LR 워밍업, FPGM 가지치기)을 적용하여 크기를 1.4M으로 축소한다.
  • 방향 분류에 네 가지 전략(가벼운 백본, 데이터 증강, 입력 해상도, PACT 양자화를 적용하여 500KB 크기를 달성한다.
  • 텍스트 인식에 아홉 가지 전략(가벼운 백본, 데이터 증강, 코사인 LR 감소, 특징 맵 해상도 조정, 정규화, LR 워밍업, 가벼운 헤드, 사전 학습 모델, PACT 양자화를 적용하여 중국어/영어 인식기는 1.6M, 알파벳은 900KB로 감소시키며 실용적인 정확도를 유지한다.
  • 대규모 다-part 데이터셋(텍스트 탐지, 방향 분류, 텍스트 인식)에서 학습하고 프랑스어, 한국어, 일본어, 독일어 등 추가 언어 커버리지를 제공한다.
  • PaddleOCR에서 pretrained 모델과 코드를 공개하여 더 넓은 재사용을 가능하게 한다.

실험 결과

연구 질문

  • RQ1현장 실세계의 장면에서 실용적 정확도를 희생하지 않고 OCR 시스템을 초경량화할 수 있는가?
  • RQ2모델 크기, 속도 및 정확도 간의 최적의 트레이드오프를 제공하는 백본, 데이터 증강, 해상도 선택 및 양자화 기술의 조합은 탐지, 방향 분류 및 인식에 대해 어떤가?
  • RQ3중국어와 영어를 넘어 알파벳 숫자, 프랑스어, 한국어, 일본어 및 독일어를 포함한 언어에서도 응집력 있는 PP-OCR 시스템이 일반화될 수 있는가?

주요 결과

  • PP-OCR 시스템은 중국어/영어 인식을 위한 총 크기 3.5M, 알파벳 숫자 인식을 위한 2.8M를 달성한다.
  • 텍스트 탐지기는 가벼운 백본과 헤드 설계 및 가지치기와 하드웨어 인식 최적화를 통해 크기를 1.4M으로 축소할 수 있다.
  • 방향 분류기는 데이터 증강과 PACT 양자화를 포함한 네 가지 전략으로 500KB 크기를 유지하면서 경쟁력 있는 정확도를 달성할 수 있다.
  • 텍스트 인식기는 가벼운 백본, 증강 데이터, PACT 양자화를 결합하여 중국어/영어는 1.6M 또는 알파벳은 900KB에 이를 수 있으며 실용적 정확도를 유지한다.
  • 광범위한 ablation 연구를 통해 백본 선택, 특징 맵 해상도, 증강 및 양자화가 정확도(HMean, F-score) 및 효율성(추론 시간)에 미치는 영향을 입증한다.
  • 저자들은 PaddleOCR를 통해 오픈소스 pretrained 모델과 코드를 제공하여 프랑스어, 한국어, 일본어, 독일어를 포함한 더 넓은 언어 적용을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.