Skip to main content
QUICK REVIEW

[논문 리뷰] Text Detection Forgot About Document OCR

Krzysztof Olejniczak, Milan Šulc|arXiv (Cornell University)|2022. 10. 14.
Handwritten Text Recognition Techniques인용 수 5
한 줄 요약

이 논문은 복잡한 환경에서 설계된 최신의 in-the-wild 텍스트 검출 모델이 구조화된 문서 데이터셋에 대해 평가되며, Google Document AI 및 AWS Textract과 같은 상용 OCR 시스템보다 뛰어난 검출 성능(F1 > 96%)을 보임을 입증한다. 사전 훈련된 CRNN 인식 모델과 조합할 경우, 종단 간 F1 스코어가 90%를 초과하여 강력한 전이 가능성과 문서 OCR 파이프라인 향상 잠재력을 입증한다.

ABSTRACT

Detection and recognition of text from scans and other images, commonly denoted as Optical Character Recognition (OCR), is a widely used form of automated document processing with a number of methods available. Yet OCR systems still do not achieve 100% accuracy, requiring human corrections in applications where correct readout is essential. Advances in machine learning enabled even more challenging scenarios of text detection and recognition "in-the-wild" - such as detecting text on objects from photographs of complex scenes. While the state-of-the-art methods for in-the-wild text recognition are typically evaluated on complex scenes, their performance in the domain of documents is typically not published, and a comprehensive comparison with methods for document OCR is missing. This paper compares several methods designed for in-the-wild text recognition and for document text recognition, and provides their evaluation on the domain of structured documents. The results suggest that state-of-the-art methods originally proposed for in-the-wild text detection also achieve competitive results on document text detection, outperforming available OCR methods. We argue that the application of document OCR should not be omitted in evaluation of text detection and recognition methods.

연구 동기 및 목표

  • 최신의 in-the-wild 텍스트 검출 모델이 구조화된 문서 이미지로 일반화되는지 평가하기.
  • 표준 문서 벤치마크 데이터셋에서 in-the-wild 검출기와 전용 문서 OCR 엔진 간 성능을 비교하기.
  • 문서 전용 데이터셋에서 공개된 인식 모델과 함께 미세조정된 in-the-wild 검출기를 조합하여 종단 간 텍스트 인식 성능 평가하기.
  • 텍스트 검출 방법 평가에 문서 OCR 평가를 포함할 중요성을 부각하기.

제안 방법

  • FUNSD, CORD, XFUND와 같은 문서 전용 데이터셋에 대해 DBNet++, TextBPN++, DCLNet, FCENet 등의 in-the-wild 텍스트 검출 모델을 미세조정하였다.
  • CLEval 메트릭을 사용하여 검출 성능을 평가하였으며, 여러 문서 데이터셋에서 F1 스코어, 정밀도, 재현율에 중점을 두었다.
  • MMOCR 및 docTR에서 제공하는 사전 훈련된 인식 모델(CRNN, SAR, MASTER)과 함께 미세조정된 검출기를 조합하여 이단계 종단 간 텍스트 인식을 수행하였다.
  • MMOCR 0.6.2 Model Zoo와 docTR에서 공개된 모델을 사용하여 재훈련을 방지함으로써 공정한 비교를 확보하였다.
  • 상용 OCR 서비스(AWS Textract, Google Document AI) 및 오픈소스 OCR(Tesseract, PP-OCR)와 결과를 비교하였다.
  • 검출 헤드에서 가변 이진화를 적용하여 문서 내 비정규형 텍스트 인스턴스의 국소화 정확도를 향상시켰다.

실험 결과

연구 질문

  • RQ1최신의 in-the-wild 텍스트 검출 모델이 전용 문서 OCR 시스템과 비교해 구조화된 문서 이미지에서 경쟁적 또는 우수한 성능을 달성할 수 있는가?
  • RQ2in-the-wild 검출기를 문서 데이터로 미세조정하면 표준 문서 벤치마크에서 검출 F1 스코어에 어떤 영향을 미치는가?
  • RQ3문서 데이터셋에서 일반 목적의 인식 모델과 함께 in-the-wild 검출기를 조합할 경우 종단 간 인식 성능은 어떠한가?
  • RQ4상용 OCR 서비스인 AWS Textract이 문서 전용으로 훈련되지 않았음에도 종단 간 평가에서 오픈소스 모델을 능가하는 이유는 무엇인가?
  • RQ5새로운 텍스트 검출 방법 평가에 문서 OCR 벤치마크를 포함해야 하는가?

주요 결과

  • DBNet++는 FUNSD에서 검출 F1 스코어 92.23%를 기록했으며, CORD에서는 96.62%를 달성하여 Google Document AI(91.42% 및 90.97%)와 AWS Textract(94.53% 및 83.32%)를 모두 능가하였다.
  • TextBPN++는 FUNSD에서 검출 F1 스코어 90.86%를 기록했고, CORD에서는 96.52%를 달성하여 문서 레이아웃에 대한 강력한 일반화 능력을 보였다.
  • CRNN와 DBNet++를 조합한 종단 간 인식은 FUNSD에서 93.52% 재현율과 92.23% F1 스코어를 기록하여 다른 검출기 및 인식 모델 조합보다 뛰어난 성능을 보였다.
  • AWS Textract는 CORD에서 종단 간 인식 F1 스코어 96.63%를 기록하여 모든 오픈소스 모델을 크게 능가하였으며, 이는 내부 인식 엔진의 뛰어난 성능 때문일 것이다.
  • 미세조정된 CRNN 모델은 in-the-wild 검출기와 조합했을 때 FUNSD에서 93% 이상, CORD에서는 98.5% 이상의 F1 스코어를 기록하여 강력한 전이 가능성 잠재력을 보였다.
  • 더 높은 검출 재현율에도 불구하고 DBNet++는 정밀도가 낮아 종단 간 F1 스코어가 가장 높지 않았으며, 이는 검출 품질만으로는 더 나은 인식 성능을 보장하지 못한다는 점을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.