Skip to main content
QUICK REVIEW

[논문 리뷰] Language Independent Single Document Image Super-Resolution using CNN for improved recognition

Ram Krishna Pandey, A. G. Ramakrishnan|arXiv (Cornell University)|2017. 01. 30.
Advanced Image Processing Techniques참고 문헌 10인용 수 11
한 줄 요약

이 논문은 저해상도 스캔을 향상시켜 OCR 정확도를 향상시키기 위해 언어 및 해상도에 관계없이 단일 이미지 초해상도 기법을 제안한다. 다섯 층의 합성곱 신경망(CNN)을 사용하여 저해상도 패치에서 고해상도 패치로의 매핑을 학습하며, 파라메트릭 ReLU 활성화 함수와 1×1 합성곱을 적용한다. 이 모델은 75 dpi 타밀어 이미지에서 최대 4 dB의 PSNR 향상을 달성하고, 단어 수준의 OCR 정확도를 3% 향상시킨다.

ABSTRACT

Recognition of document images have important applications in restoring old and classical texts. The problem involves quality improvement before passing it to a properly trained OCR to get accurate recognition of the text. The image enhancement and quality improvement constitute important steps as subsequent recognition depends upon the quality of the input image. There are scenarios when high resolution images are not available and our experiments show that the OCR accuracy reduces significantly with decrease in the spatial resolution of document images. Thus the only option is to improve the resolution of such document images. The goal is to construct a high resolution image, given a single low resolution binary image, which constitutes the problem of single image super-resolution. Most of the previous work in super-resolution deal with natural images which have more information-content than the document images. Here, we use Convolution Neural Network to learn the mapping between low and the corresponding high resolution images. We experiment with different number of layers, parameter settings and non-linear functions to build a fast end-to-end framework for document image super-resolution. Our proposed model shows a very good PSNR improvement of about 4 dB on 75 dpi Tamil images, resulting in a 3 % improvement of word level accuracy by the OCR. It takes less time than the recent sparse based natural image super-resolution technique, making it useful for real-time document recognition applications.

연구 동기 및 목표

  • 고해상도 대체 자료가 없을 경우 저해상도 문서 이미지가 OCR 성능을 떨어뜨리는 문제를 해결한다.
  • 저주파 성분이 적은 문서 이미지에 특화된 빠르고 엔드 투 엔드 딥 러닝 프레임워크를 개발한다.
  • 다양한 언어(Tamil, Kannada, English)와 다수의 해상도(50–300 DPI) 문서 이미지로 훈련하여 언어 및 해상도 독립성을 확보한다.
  • 초해상도를 통해 이미지 품질을 향상시켜 전통적인 보간법과 희소 코딩 방법보다 우수한 OCR 정확도를 달성한다.
  • 실시간 배포가 가능한 문서 인식 파이프라인에 적합한 경량 CNN 아키텍처를 설계한다.

제안 방법

  • 첫 번째 은닉층 이후에 1×1 합성곱 필터를 사용하여 비선형성 향상과 특징 차원 감소를 달성하기 위해 다섯 층의 CNN을 훈련한다.
  • 파라메트릭 ReLU(PReLU)와 ReLU 활성화 함수를 사용하여 적응형 비선형성을 학습함으로써 특징 표현과 모델 성능을 향상시킨다.
  • 세 언어(Tamil, Kannada, English)와 세 해상도(100–300 DPI)의 135개 문서 이미지에서 510만 개의 고해상도-저해상도 패치 쌍(10×10 고해상도, 16×16 저해상도)으로 구성된 훈련 데이터셋을 구축한다.
  • 입력 패치의 안정적인 훈련을 위해 전역 평균을 빼고 [0,1]로 범위 정규화하는 공간 정규화를 적용한다.
  • 50 에포크 동안 학습률 0.0001, 배치 크기 32로 평균 제곱오차(MSE) 손실과 확률적 경사 하강법(SGD)을 사용하여 모델을 최적화한다.
  • 비쿠빅 보간법을 기준선으로 비교하며, 별도의 테스트 세트에서 PSNR 및 OCR 단어/문자 정확도를 평가한다.

실험 결과

연구 질문

  • RQ1언어별 맞춤형 미세조정 없이도 단일 CNN 기반 초해상도 모델이 여러 언어(Tamil, Kannada, English)에 일반화될 수 있는가?
  • RQ2제안된 CNN이 저해상도 문서 이미지에서 비쿠빅 보간법과 희소 코딩 방법에 비해 PSNR와 OCR 정확도를 얼마나 향상시키는가?
  • RQ31×1 합성곱과 PReLU 활성화 함수의 사용이 문서 이미지 초해상도에서 성능과 모델 효율성에 어떤 영향을 미치는가?
  • RQ4모델이 다양한 입력 해상도(50–300 DPI)에서 일관된 성능을 유지하는가? 이는 해상도 독립성을 나타내는가?
  • RQ5제안된 방법이 스캔된 문서 처리를 위한 OCR 파이프라인에 실시간으로 구현 가능한가?

주요 결과

  • 제안된 CNN 모델은 150 DPI 입력에 대해 비쿠빅 보간법 대비 최대 7.8 dB의 PSNR 향상을 달성하고, 75 DPI 타밀어 이미지에선 4 dB 향상된다.
  • 75 dpi 타밀어 이미지에서 모델은 단어 수준 OCR 정확도를 비쿠빅 기반의 59.6%에서 62.9%로 3.3%포인트 향상시킨다.
  • PReLU 활성화 함수를 사용한 CNN은 ReLU보다 우수한 성능을 보이며, 150 DPI 타밀어 이미지에서 28.48 dB의 PSNR를 기록한 반면, ReLU는 28.29 dB를 기록한다.
  • 모델은 언어와 해상도 간에 일반화되며, 50–300 DPI 범위에서 영어, 타밀어, 칸나다어 문서에서 일관된 PSNR 향상을 보인다.
  • 최근의 희소 기반 초해상도 기법보다 유의미하게 낮은 추론 시간을 기록하여 문서 인식 시스템에서 실시간 적용이 가능하다.
  • 첫 번째 은닉층 이후로 연속 세 층에 1×1 합성곱을 적용함으로써 표준 3층 아키텍처보다 성능 향상을 이룬다. 이는 비선형성 향상과 차원 감소를 동시에 개선한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.