Skip to main content
QUICK REVIEW

[논문 리뷰] OCR ACCURACY IMPROVEMENT ON DOCUMENT IMAGES THROUGH A NOVEL PRE-PROCESSING APPROACH

A. El Harraj, Naoufal Raissouni|arXiv (Cornell University)|2015. 09. 11.
Handwritten Text Recognition Techniques인용 수 12
한 줄 요약

이 논문은 디지털 카메라 및 모바일 기기에서 촬영한 열악한 조건의 문서 이미지에 대해 OCR 정확도를 향상시키기 위한 새로운 비모수적이고 비지도 학습 기반의 전처리 파이프라인을 제안한다. 국소적 밝기/대비 조정, 최적화된 회색조 변환, 엣지 강조 처리, 전역 이진화를 순차적으로 적용함으로써, 표준 벤치마크에서 텍스트 검출 및 OCR 성능이 크게 향상된다.

ABSTRACT

Digital camera and mobile document image acquisition are new trends arising in the world of Optical Character Recognition and text detection. In some cases, such process integrates many distortions and produces poorly scanned text or text-photo images and natural images, leading to an unreliable OCR digitization. In this paper, we present a novel nonparametric and unsupervised method to compensate for undesirable document image distortions aiming to optimally improve OCR accuracy. Our approach relies on a very efficient stack of document image enhancing techniques to recover deformation of the entire document image. First, we propose a local brightness and contrast adjustment method to effectively handle lighting variations and the irregular distribution of image illumination. Second, we use an optimized greyscale conversion algorithm to transform our document image to greyscale level. Third, we sharpen the useful information in the resulting greyscale image using Un-sharp Masking method. Finally, an optimal global binarization approach is used to prepare the final document image to OCR recognition. The proposed approach can significantly improve text detection rate and optical character recognition accuracy. To demonstrate the efficiency of our approach, an exhaustive experimentation on a standard dataset is presented

연구 동기 및 목표

  • 모바일 기기로 촬영한 문서 이미지에서 빛의 세기 변화와 왜곡으로 인한 OCR 오류를 해결하기 위해.
  • 라벨이 부여된 데이터나 모델 학습이 필요 없이 이미지 품질을 향상시킬 수 있는 비모수적이고 비지도 학습 기반의 전처리 방법을 개발하기 위해.
  • 이미지 대비, 선명도, 이진화를 체계적으로 향상시켜 텍스트 검출 및 OCR 정확도를 향상시키기 위해.
  • 실제 촬영 환경에서 다양한 이미지 품질 문제를 다루는 데 효과적인지 표준 데이터셋을 기반으로 검증하기 위해.

제안 방법

  • 문서 이미지 전반에 걸쳐 균일하지 않은 조명과 빛의 세기 변화를 보정하기 위해 국소적 밝기 및 대비 조정 기법을 적용한다.
  • 입력된 색상 이미지를 고품질의 회색조 표현으로 변환하기 위해 최적화된 회색조 변환 알고리즘을 사용한다.
  • 회색조 이미지에 대해 엣지 세부 정보를 강조하고 텍스트 특징을 선명하게 하기 위해 엣지 강조 처리를 적용한다.
  • 향상된 회색조 이미지를 OCR 처리에 적합한 이진 형식으로 변환하기 위해 최적의 전역 이진화 방법을 사용한다.
  • 전체 전처리 파이프라인은 이미지 향상 작업의 스택으로 순차적으로 적용된다.
  • 이 방법은 완전히 비지도 학습 기반이며 비모수적이다. 외부 매개변수나 학습 데이터가 필요로 하지 않는다.

실험 결과

연구 질문

  • RQ1모바일 기기나 디지털 카메라로 촬영한 문서 이미지에서 조명 문제와 왜곡으로 인한 OCR 정확도를 어떻게 향상시킬 수 있는가?
  • RQ2어떤 전처리 기법의 조합이 OCR에 적합한 문서 이미지를 가장 효과적으로 향상시킬 수 있는가?
  • RQ3사전에 원본 이미지에 대한 지식이 없이도 비모수적이고 비지도 학습 기반의 접근 방식이 다양한 이미지 열악한 조건을 다루는 데 기존 방법보다 뛰어난 성능을 보일 수 있는가?

주요 결과

  • 제안된 전처리 파이프라인은 균일하지 않은 조명과 낮은 대비를 가진 문서 이미지에서 텍스트 검출률을 크게 향상시킨다.
  • 국소적 대비 조정, 최적화된 회색조 변환, 엣지 강조 처리, 전역 이진화의 조합은 OCR 정확도 향상에 명백한 성과를 거둔다.
  • 학습 데이터나 매개변수 조정 없이도 다양한 실제 문서 이미지에서 강인한 성능을 달성한다.
  • 표준 데이터셋을 활용한 실험을 통해, 도전적인 촬영 조건에서도 이 방법이 OCR 신뢰도를 향상시키는 데 효과적임을 확인한다.
  • 비지도 학습 기반이자 비모수적이라는 점이 다양한 문서 유형과 촬영 장치에 광범위하게 적용 가능함을 보장한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.