Skip to main content
QUICK REVIEW

[논문 리뷰] Binary Document Image Super Resolution for Improved Readability and OCR Performance

Ram Krishna Pandey, K. Vignesh|arXiv (Cornell University)|2018. 12. 06.
Advanced Image Processing Techniques참고 문헌 33인용 수 22
한 줄 요약

이 논문은 저해상도 이진 타밀 문서 이미지의 읽기 가능성과 OCR 정확도를 햖스키기 위해 딥러닝 기반 단일 이미지 초해상도 복원(SISR) 방법을 제안한다. 서브픽셀 컨볼루션과 PReLU 활성화 함수를 사용한 컨volutional 신경망을 활용하고, 후처리 단계로 파wr 레인지 변환을 적용함으로써 최고의 모델이 입력 이미지 대비 146.5%의 상대적 OCR 정확도 향상을 달성한다.

ABSTRACT

There is a need for information retrieval from large collections of low-resolution (LR) binary document images, which can be found in digital libraries across the world, where the high-resolution (HR) counterpart is not available. This gives rise to the problem of binary document image super-resolution (BDISR). The objective of this paper is to address the interesting and challenging problem of super resolution of binary Tamil document images for improved readability and better optical character recognition (OCR). We propose multiple deep neural network architectures to address this problem and analyze their performance. The proposed models are all single image super-resolution techniques, which learn a generalized spatial correspondence between the LR and HR binary document images. We employ convolutional layers for feature extraction followed by transposed convolution and sub-pixel convolution layers for upscaling the features. Since the outputs of the neural networks are gray scale, we utilize the advantage of power law transformation as a post-processing technique to improve the character level pixel connectivity. The performance of our models is evaluated by comparing the OCR accuracies and the mean opinion scores given by human evaluators on LR images and the corresponding model-generated HR images.

연구 동기 및 목표

  • 고해상도 대응 이미지가 확보되지 않은 저해상도(75 dpi) 이진 타밀 문서 이미지의 가독성 향상과 OCR 성능 향상에 도전한다.
  • 특히 역사적·문화적 디지털화 프로젝트인 프로젝트 마두라이와 같은 분야에 특화된, 이진 문서 이미지 초해상도 복원(BDISR)을 위한 딥 네트워크 아키텍처를 개발한다.
  • 희박한 픽셀 연결성을 가진 이진 텍스트 중심 문서 이미지에 최적화되지 않은 기존 초해상도 방법의 한계를 극복한다.
  • BDISR 모델의 훈련 및 평가를 지원하기 위해 쌍체의 저해상도 및 고해상도 타밀 문서 이미지 패치로 구성된 공개 가능한 데이터셋을 구축한다.
  • 후처리 기법을 통해 초해상도 이미지의 픽셀 연결성과 구조적 정밀도를 향상시켜 OCR 성능을 향상시킨다.

제안 방법

  • 특징 추출을 위한 컨volution 레이어와 스케일업을 위한 전치 또는 서브픽셀 컨볼루션 레이어를 사용한 여러 SISR 아키텍처를 제안한다.
  • 깊은 네트워크에서 훈련 안정성과 기울기 흐름 향상을 위해 잔차 연결을 구현한다.
  • 학습 가능한 음수 기울기를 허용하여 ReLU 대비 특징 표현을 향상시키기 위해 PReLU 활성화 함수를 사용한다.
  • 최종 출력의 픽셀 연결성 향상과 노이즈 감소를 위해 후처리 단계로 파워 레인지 변환을 적용한다.
  • 저해상도 및 고해상도 타밀 문서 패치의 맞춤형 데이터셋을 사용하여 2× 및 4× 스케일업을 위한 모델을 훈련한다.
  • 전치 컨볼루션, 서브픽셀 컨볼루션, 잔차 연결 스트림의 출력을 비교하고 통합하기 위해 삼중 스트림 평행 네트워크 아키텍처를 구현한다.

실험 결과

연구 질문

  • RQ1딥 네트워크는 타밀 텍스트를 위한 저해상도에서 고해상도 이진 문서 이미지로의 매핑을 효과적으로 학습할 수 있는가?
  • RQ2전치 컨볼루션과 서브픽셀 컨볼루션 간의 다른 스케일업 레이어가 초해상도 이미지의 품질과 OCR 성능에 어떤 영향을 미치는가?
  • RQ3이진 문서 초해상도 복원 맥락에서 PReLU 활성화 함수가 ReLU 대비 성능 향상에 얼마나 기여하는가?
  • RQ4파워 레인지 변환은 초해상도 이진 이미지의 픽셀 연결성과 OCR 정확도 향상에 얼마나 효과적인가?
  • RQ5맞춤형 타밀 문서 이미지 데이터셋은 딥러닝 기반 초해상도 복원을 통해 OCR 정확도 향상에 기여할 수 있는가?

주요 결과

  • 서브픽셀 컨볼루션과 PReLU 활성화를 사용한 CTS-PReLU-×4 모델은 원본 저해상도 입력 이미지 대비 146.5%의 상대적 OCR 정확도 향상을 달성했다.
  • 서브픽셀 컨볼루션 기반 스트림은 전치 컨볼루션 및 잔차 연결 스트림을 모두 초월했으며, 특히 미세한 텍스트 세부 정보를 잘 유지하는 데 뛰어났다.
  • 4× 스케일업은 2× 스케일업에 비해 문자의 구조적 정밀도와 연결성이 향상되어 OCR 정확도가 크게 향상되었다.
  • 파워 레인지 변환 후처리가 OCR 정확도를 약간 향상시켰으며, CTSγ-PReLU-×4 모델은 입력 이미지 대비 107%의 상대적 정확도 향상을 기록했다.
  • 인간 평가자들은 CTS 모델 출력을 가장 높은 시각적 품질로 평가했으며, 타밀어 모국어 사용자와 비타밀어 사용자 모두 4× 스케일업 결과를 선호했다.
  • 제안된 모델은 기준 모델보다 뚜렷하게 뛰어난 성능을 보였으며, CTS-PReLU-×4 설정은 전치 컨볼루션 기반 모델보다 약 10% 높은 OCR 정확도, 잔차 연결 스트림 기반 모델보다 약 8% 높은 정확도를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.