Skip to main content
QUICK REVIEW

[논문 리뷰] Telugu OCR Framework using Deep Learning

Rakesh Achanta, Trevor Hastie|arXiv (Cornell University)|2015. 09. 20.
Handwritten Text Recognition Techniques참고 문헌 23인용 수 15
한 줄 요약

이 논문은 텔루구어의 복잡한 복합어음기호 체계인 텔루구 문자에 대해 종단 간 딥러닝 프레임워크를 제안한다. 수학적 형태학을 활용한 텍스트 분할, 문자 분류를 위한 딥 컨volution 네트워크(CNN), 라인 추출을 위한 제3차 마르코프 체인 언어 모델을 결합한다. 이는 고도로 발전된 신경망 기법과 핵심 학습 관행에 대한 통계적 근거를 통합함으로써 텔루구 문자에서 최고의 성능을 달성한다.

ABSTRACT

In this paper, we address the task of Optical Character Recognition(OCR) for the Telugu script. We present an end-to-end framework that segments the text image, classifies the characters and extracts lines using a language model. The segmentation is based on mathematical morphology. The classification module, which is the most challenging task of the three, is a deep convolutional neural network. The language is modelled as a third degree markov chain at the glyph level. Telugu script is a complex alphasyllabary and the language is agglutinative, making the problem hard. In this paper we apply the latest advances in neural networks to achieve state-of-the-art error rates. We also review convolutional neural networks in great detail and expound the statistical justification behind the many tricks needed to make Deep Learning work.

연구 동기 및 목표

  • 텔루구어의 복잡하고 복합어음기호 체계인 텔루구 문자에 대해 기존의 해결책이 제한적인 광학 문자 인식(OCR) 문제를 해결하기 위해.
  • 텍스트 분할, 문자 분류, 선 수준 언어 모델링을 통합한 종단 간 프레임워크를 개발하여 정확도를 향상시키기 위해.
  • 딥러닝의 최신 발전을 적용하여 텔루구 OCR에서 최고의 오류율을 달성하고자 하며, 이는 문자의 구조적 복잡성에도 불구하고 성립한다.
  • 이 프레임워크에서 사용된 핵심 딥러닝 기법들, 예를 들어 배치 정규화와 드롭아웃에 대한 통계적 근거를 제공하기 위해.

제안 방법

  • 입력 이미지에서 개별 텍스트 라인과 문자를 분리하기 위해 수학적 형태학을 사용하여 텍스트 분할을 수행한다.
  • 텔루구 기호의 시각적 복잡성을 처리할 수 있도록 설계된 아키텍처 구성 요소를 갖춘 딥 컨volution 네트워크(CNN)를 문자 분류에 활용한다.
  • 글리프 수준에서 제3차 마르코프 체인을 사용하여 언어적 구조를 모델링하고, 순서 수준의 정확도를 향상시킨다.
  • 분할, 분류, 언어 모델링을 종단 간 파이프라인으로 통합하여 전체 OCR 성능을 향상시킨다.
  • 저자들은 CNN에 대한 종합적인 검토를 제공하며, 가중치 초기화 및 정규화와 같은 일반적인 딥러닝 관행에 통계적 추론을 사용하여 근거를 제시한다.

실험 결과

연구 질문

  • RQ1텔루구 OCR의 분할, 분류, 언어 모델링 단계를 처리할 수 있는 종단 간 딥러닝 프레임워크는 어떻게 설계할 수 있는가?
  • RQ2시각적 변동성에도 불구하고 딥 컨volution 네트워크는 어떻게 복잡한 텔루구 문자를 정확하게 분류하는가?
  • RQ3글리프 수준에서 제3차 마르코프 체인이 선 수준의 정확도 향상에 얼마나 효과적인가?
  • RQ4핵심 딥러닝 기법들의 성공을 뒷받침하는 통계적 원리는 무엇인가?

주요 결과

  • 제안된 프레임워크는 벤치마크 데이터셋에서 기존 방법보다 뛰어난 최고의 오류율을 달성한다.
  • 분할을 위한 수학적 형태학의 통합은 노이즈가 많거나 품질이 낮은 이미지에서 안정적으로 텍스트 라인과 문자를 분리할 수 있게 한다.
  • 딥 컨volution 네트워크 컴포넌트는 텔루구 기호에 대해 강력한 일반화 성능을 보이며, 문자의 복잡성에도 불구하고 복잡한 공간 패턴을 효과적으로 포착한다.
  • 제3차 마르코프 언어 모델은 인접한 글리프 간의 문맥적 의존성을 활용하여 정확도를 크게 향상시킨다.
  • 딥러닝 기법에 대한 통계 분석은 배치 정규화와 드롭아웃과 같은 연습에 이론적 기반을 제공하며, 학습 안정성과 모델 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.