Skip to main content
QUICK REVIEW

[논문 리뷰] A Generic Method for Automatic Ground Truth Generation of Camera-captured Documents

Sheraz Ahmed, Muhammad Imran Malik|arXiv (Cornell University)|2016. 05. 04.
Handwritten Text Recognition Techniques참고 문헌 21인용 수 4
한 줄 요약

이 논문은 캠éra로 촬영한 문서 이미지의 지도 레이블을 자동으로 생성하기 위한 일반적이고 자동화된 방법을 제시한다. 이 방법은 국소적으로 유사한 배열 해싱(LLAH)을 사용하여 촬영된 이미지를 전자적 PDF 버전과 정렬한다. 이 방법을 통해 다국어에서 100만 단어, 1,000만 문자의 대규모 데이터셋을 완전히 자동으로 생성할 수 있으며, 지도 레이블의 정확도는 99.98%에 이른다. 또한 C³Wᵢ 데이터셋과 LLM 기반의 OCR 모델을 도입하여 실제 왜곡이 있는 이미지에서 95.10%의 정확도를 달성하였다. 이는 블러와 낮은 조도에 강건한 성능으로 ABBYY(75.02%)와 Tesseract(50.22%)를 크게 앞서는 성과이다.

ABSTRACT

The contribution of this paper is fourfold. The first contribution is a novel, generic method for automatic ground truth generation of camera-captured document images (books, magazines, articles, invoices, etc.). It enables us to build large-scale (i.e., millions of images) labeled camera-captured/scanned documents datasets, without any human intervention. The method is generic, language independent and can be used for generation of labeled documents datasets (both scanned and cameracaptured) in any cursive and non-cursive language, e.g., English, Russian, Arabic, Urdu, etc. To assess the effectiveness of the presented method, two different datasets in English and Russian are generated using the presented method. Evaluation of samples from the two datasets shows that 99:98% of the images were correctly labeled. The second contribution is a large dataset (called C3Wi) of camera-captured characters and words images, comprising 1 million word images (10 million character images), captured in a real camera-based acquisition. This dataset can be used for training as well as testing of character recognition systems on camera-captured documents. The third contribution is a novel method for the recognition of cameracaptured document images. The proposed method is based on Long Short-Term Memory and outperforms the state-of-the-art methods for camera based OCRs. As a fourth contribution, various benchmark tests are performed to uncover the behavior of commercial (ABBYY), open source (Tesseract), and the presented camera-based OCR using the presented C3Wi dataset. Evaluation results reveal that the existing OCRs, which already get very high accuracies on scanned documents, have limited performance on camera-captured document images; where ABBYY has an accuracy of 75%, Tesseract an accuracy of 50.22%, while the presented character recognition system has an accuracy of 95.10%.

연구 동기 및 목표

  • 캠éra로 촬영한 문서 이미지에서 훈련 및 테스트를 위한 대규모로 공개 가능한 데이터셋이 부족한 문제를 해결하기 위해.
  • 캠éra로 촬영한 문서 이미지에 대해 정확한 지도 레이블을 생성하기 위한 인간 간섭이 없는 자동화된 방법을 개발하기 위해.
  • 실제 왜곡(예: 블러, 투시 휘어짐 등)을 포함한 실제 세계의 왜곡을 반영한 100만 개의 단어 이미지와 1,000만 개의 문자 이미지를 포함한 대규모 실세계 데이터셋(C³Wᵢ)을 생성하기 위해.
  • 신규로 생성된 데이터셋을 기반으로 딥러닝 모델을 훈련시켜 캠éra로 촬영한 문서 이미지에서의 OCR 성능을 향상시키기 위해.
  • 실제 캠éra로 촬영한 이미지에서 최신 기술의 OCR(Available, Tesseract)와 제안된 시스템을 비교 평가하여 실제 왜곡 조건에서의 성능 격차를 드러내기 위해.

제안 방법

  • 이 방법은 국소적으로 유사한 배열 해싱(LLAH)을 사용하여, 부분적인 콘텐츠만 존재하는 경우에도 문서의 전자적 PDF 버전과 캠éra로 촬영한 이미지를 정렬할 수 있다.
  • LLAH 기반 문서 검색을 통해 촬영된 이미지에서 단어와 문자를 자동으로 국소화하고 추출한다. 이는 PDF의 해당 텍스트와 매칭됨으로써 이루어진다.
  • 이 시스템은 레이블링 과정에서 인간 간섭 없이 작동하므로 완전히 자동화되고 수백만 장의 이미지에까지 스케일업이 가능하다.
  • 이 방법은 언어에 관계없이 스크립트에 독립적이므로, 영어, 러시아어, 아랍어, 우르두어, 일본어 등 필기체와 비필기체 스크립트 모두에 적용 가능하다.
  • 이 방법을 통해 새로운 데이터셋인 C³Wᵢ이 생성되었으며, 이는 실제 캠éra로 촬영한 문서에서 유래한 100만 개의 단어 이미지와 1,000만 개의 문자 이미지를 포함한다.
  • LLM 기반의 문자 인식 모델이 C³Wᵢ 데이터셋을 기반으로 훈련되어, 이질화, 투시 휘어짐, 낮은 조도 등의 왜곡을 이진화에 의존하지 않고도 잘 처리할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1완전히 자동화되고 일반적인 방법으로 인간 간섭 없이 캠éra로 촬영한 문서 이미지에 대해 정확한 지도 레이블을 생성할 수 있는가?
  • RQ2LLAH 기반 문서 검색이 지도 레이블 생성을 위한 캠éra로 촬영한 이미지와 전자적 PDF 버전 간의 정확한 정렬을 얼마나 잘 실현할 수 있는가?
  • RQ3제안된 C³Wᵢ 데이터셋이 실제 왜곡(예: 블러, 낮은 조도 등)을 다루는 OCR 시스템을 훈련시키는 데 얼마나 효과적인가?
  • RQ4C³Wᵢ 데이터셋을 기반으로 훈련된 LSTM 기반 OCR이 기존 상용 및 오픈소스 OCR보다 캠éra로 촬영한 문서 이미지에서 더 뛰어난 성능을 보일 수 있는가?
  • RQ5제안된 OCR 시스템은 재학습 없이도 스캔된 문서 이미지에서도 뛰어난 성능을 유지하는가? 이는 일반화 능력을 시사한다.

주요 결과

  • 제안된 자동 지도 레이블 생성 방법은 영어 및 러시아어 데이터셋에서 샘플링된 이미지에서 99.98%의 레이블링 정확도를 달성하여 높은 신뢰성을 입증하였다.
  • C³Wᵢ 데이터셋은 100만 개의 단어 이미지와 1,000만 개의 문자 이미지를 포함하며, 모두 실제 캠éra로 촬영한 문서에서 유래한 진짜 왜곡(예: 블러, 투시 휘어짐, 다양한 조도 조건)을 반영하고 있다.
  • 제안된 LSTM 기반 OCR은 C³Wᵢ 데이터셋에서 95.10%의 인식 정확도를 달성하였으며, 캠éra로 촬영한 이미지에서 ABBYY(75.02%)와 Tesseract(50.22%)를 크게 앞서는 성능을 보였다.
  • 심한 블러와 낮은 조도가 있는 이미지에서는 제안된 시스템이 86.8%의 정확도를 기록했고, ABBYY와 Tesseract는 각각 19.57%와 18.1%에 머물러, 본 시스템의 뛰어난 강건성을 입증하였다.
  • 언어 모델링 없이도 시스템이 잘 작동하며, 'voes'가 'votes'로 잘못 인식되는 등의 경미한 오류가 발생할 수 있으나, 언어 모델링을 통해 보정이 가능하다.
  • 시스템은 스캔된 문서 이미지에도 잘 일반화되어 있어, 캠éra로 촬영한 데이터로 훈련된 동일한 모델이 스캔된 입력에도 효과적으로 작동할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.