Skip to main content
QUICK REVIEW

[논문 리뷰] Statistical Learning for OCR Text Correction

Jie Mei, Aminul Islam|arXiv (Cornell University)|2016. 11. 21.
Handwritten Text Recognition Techniques참고 문헌 20인용 수 14
한 줄 요약

이 논문은 OCR 텍스트 보정을 위한 통계적 학습 모델을 제안하며, Damerau-Levenshtein 거리 기반 어휘 검색을 통해 OCR 출력을 초월한 후보 제안을 확장하고, 편집 거리, 문맥 유사도, 어휘 특성 등의 OCR 전용 특징을 회귀 프레임워크에 통합한다. 모델은 상위 1개 후보 제안 시 61.5%의 보정률을 기록하고 상위 3개 후보 제안 시 71.5%를 기록하며, 이는 78%의 이론적 상한선에 근접한다.

ABSTRACT

The accuracy of Optical Character Recognition (OCR) is crucial to the success of subsequent applications used in text analyzing pipeline. Recent models of OCR post-processing significantly improve the quality of OCR-generated text, but are still prone to suggest correction candidates from limited observations while insufficiently accounting for the characteristics of OCR errors. In this paper, we show how to enlarge candidate suggestion space by using external corpus and integrating OCR-specific features in a regression approach to correct OCR-generated errors. The evaluation results show that our model can correct 61.5% of the OCR-errors (considering the top 1 suggestion) and 71.5% of the OCR-errors (considering the top 3 suggestions), for cases where the theoretical correction upper-bound is 78%.

연구 동기 및 목표

  • 기존 OCR 후처리 모델이 OCR 엔진 출력에 국한된 후보 제안을 제한함으로써, 어떤 OCR에서도 인식되지 않은 오류에 대한 보정을 놓치는 문제를 해결한다.
  • 낮은 빈도이지만 올바른 보정을 우선시하지 못하는 n-gram 빈도 기반 모델의 편향을 해소한다.
  • 다양한 OCR 전용 특징을 통합한 통합 회귀 프레임워크를 통해 OCR 오류 보정 정확도를 향상시킨다.
  • 재현 가능한 후처리 모델 평가를 위한 지상 진실 OCR 오류 데이터셋을 제공한다.
  • 다양한 특징과 회귀 모델을 조합할 경우 기반선 방법에 비해 보정 성능이 크게 향상됨을 입증한다.

제안 방법

  • 각 OCR 오류에서 Damerau-Levenshtein 편집 거리 δ 이내의 모든 단어를 생성함으로써 후보 공간을 확장하여, OCR 엔진이 놓친 보정을 발견할 수 있도록 한다.
  • 편집 거리, 어휘 유사도, 언어 모델 점수, 문맥 단어 인기도, 유연한 문맥 매칭 등 OCR 전용 특징을 통합한다.
  • 히우리스틱 또는 빈도 기반 선택에 의존하지 않고, 특징 점수를 기반으로 후보 보정을 순위 매기는 데 회귀 모델(예: 랜덤 포레스트, AdaBoost.R2)을 사용한다.
  • Biodiversity Heritage Library의 한 권의 책에서 유도된 지상 진실 OCR 오류 및 그 정답 보정의 데이터셋을 기반으로 회귀 모델을 훈련시킨다.
  • 특징 제거 실험과 시각화를 통해 개별 특징의 기여도와 보정을 찾는 데서의 독창성을 평가한다.
  • 정밀도@k(P@k) 메트릭을 사용해 여러 오류 유형(제한된, 비제한된, 참양성, 거짓양성)에 걸쳐 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1OCR 엔진 출력을 초월한 후보 제안 공간 확장을 통해 OCR 오류 보정 정확도를 향상시킬 수 있는가?
  • RQ2편집 거리, 문맥 유사도, 어휘 특성 등의 OCR 전용 특징이 n-gram 빈도만을 고려한 것에 비해 보정 성능 향상에 얼마나 기여하는가?
  • RQ3히우리스틱 또는 빈도 기반 방법에 비해 회귀 기반 순위 매기기 모델이 큰 후보 집합에서 정확한 보정을 선택하는 데 얼마나 효과적인가?
  • RQ4개별 특징은 정확한 보정을 찾는 데 어떤 기여를 하는가? 그리고 다양한 오류 유형에 따라 이 기여도는 어떻게 다를까?
  • RQ5통계적 학습 모델은 OCR 오류의 이론적 상한선 보정 정확도에 얼마나 가까이 다가설 수 있는가?

주요 결과

  • 제안된 모델은 정답이 상위 1개 후보에 포함될 경우 61.5%의 보정률을 기록하고 상위 3개 후보에 포함될 경우 71.5%를 기록하며, 이는 이론적 상한선 78%에 근접한다.
  • 보정되지 않은 오류의 25.9%에 대해 정확한 단어가 상위 3개 후보에 포함되어 있어 강력한 후보 커버리지가 확인되었다.
  • 여러 특징을 조합함으로써 모델 성능이 크게 향상되었으며, 특히 제한된 오류에는 문맥 기반 특징이, 거짓양성 오류에는 편집 거리/어휘 특징이 특히 효과적이었다.
  • 랜덤 포레스트 및 AdaBoost.R2와 같은 앙상블 회귀 모델이 SVR 및 MLP와 같은 단일 모델보다 성능이 뛰어나며, 더 높은 정밀도@k와 더불어 더 뛰어난 내구성을 보였다.
  • 정확한 문맥 인기도보다 유연한 문맥 인기도 특징이 커버리지에서 더 뛰어나며, 문맥 기반 특징은 다른 특징들이 놓친 보정을 찾는 데 효과적이었다.
  • 모든 특징을 사용했을 경우, 전체 보정의 78.0%가 상위 10개 후보 내에 포함되어 있어 전체적인 후보 공간 커버리지가 매우 우수함을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.