Skip to main content
QUICK REVIEW

[논문 리뷰] End to End Recognition System for Recognizing Offline Unconstrained Vietnamese Handwriting

Anh Duc Le, Hung Tuan Nguyen|arXiv (Cornell University)|2019. 05. 14.
Handwritten Text Recognition Techniques참고 문헌 22인용 수 4
한 줄 요약

이 논문은 외부 언어 모델 없이도 오프라인 비제약 조건 베트남어 손글씨 인식을 위한 엔드 투 엔드 주의 기반 인코더-디코더 모델(AED)을 제안한다. 이 모델은 특징 추출에 DenseNet을, 시퀀스 생성에 주의 기반 LSTM 디코더를 사용한다. 모델은 외부 언어 모델 없이 VNOnDB-Word 데이터셋에서 12.30%의 단어 오류율(WER)을 달성하여 기준 시스템을 능가하고, 공개 대회에서 구글의 성능과도 맞먹는다.

ABSTRACT

Inspired by recent successes in neural machine translation and image caption generation, we present an attention based encoder decoder model (AED) to recognize Vietnamese Handwritten Text. The model composes of two parts: a DenseNet for extracting invariant features, and a Long Short-Term Memory network (LSTM) with an attention model incorporated for generating output text (LSTM decoder), which are connected from the CNN part to the attention model. The input of the CNN part is a handwritten text image and the target of the LSTM decoder is the corresponding text of the input image. Our model is trained end-to-end to predict the text from a given input image since all the parts are differential components. In the experiment section, we evaluate our proposed AED model on the VNOnDB-Word and VNOnDB-Line datasets to verify its efficiency. The experiential results show that our model achieves 12.30% of word error rate without using any language model. This result is competitive with the handwriting recognition system provided by Google in the Vietnamese Online Handwritten Text Recognition competition.

연구 동기 및 목표

  • 손글씨 특징나열이나 외부 언어 모델에 의존하지 않고 비제약 조건의 베트남어 손글씨 텍스트를 인식하기 위한 엔드 투 엔드 딥 러닝 시스템을 개발하는 것.
  • 복잡한 다이어크리틱 기호와 음성 기호를 가진 언어인 베트남어의 정확도를 향상시키기 위해 통합된 신경망 아키텍처를 사용하는 것.
  • 표준 벤치마크인 VNOnDB-Word 및 VNOnDB-Line 데이터셋에서 모델 성능을 평가하는 것.
  • 공개 대회 환경에서 최신 기술 수준의 시스템, 특히 구글의 솔루션과의 경쟁에서의 성능을 입증하는 것.

제안 방법

  • 모델은 손글씨 이미지 입력에서 계층적이고 공간적으로 불변하는 특징을 추출하기 위해 DenseNet 백본을 사용한다.
  • 이동 중에 관련 이미지 영역에 집중할 수 있도록 주의 메커니즘이 LSTM 디코더에 통합된다.
  • 모든 구성 요소가 미분 가능하기 때문에, 전체 시스템은 역전파를 사용해 엔드 투 엔드로 훈련된다.
  • 인코더는 입력 이미지를 처리하여 맥락 인식 특징 표현을 생성한다.
  • 디코더는 인코딩된 특징과 이미지에 대한 주의를 조건으로 하여 자동으로 토큰을 생성한다.
  • 손실 함수는 예측된 텍스트 시퀀스와 진짜 텍스트 시퀀스 간의 교차 엔트로피 기반이다.

실험 결과

연구 질문

  • RQ1외부 언어 모델 없이도 엔드 투 엔드 주의 기반 인코더-디코더 모델이 비제약 조건의 베트남어 손글씨 인식에서 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2DenseNet과 주의 강화된 LSTM의 조합이 베트남어 손글씨의 복잡한 시각적 및 순차적 패턴을 얼마나 효과적으로 포착하는가?
  • RQ3제안된 모델이 VNOnDB-Word 및 VNOnDB-Line과 같은 표준 벤치마크에서 기존 시스템을 능가하는가?
  • RQ4실제 응용에서 흔히 볼 수 있는 비제약 조건의 글쓰기 스타일에 대해 모델이 얼마나 잘 일반화되는가?

주요 결과

  • 제안된 AED 모델은 외부 언어 모델을 사용하지 않고도 VNOnDB-Word 데이터셋에서 12.30%의 단어 오류율(WER)을 달성한다.
  • 모델의 성능은 베트남어 온라인 손글씨 텍스트 인식 대회에서 최고 성과를 낸 구글의 시스템과도 경쟁 가능하다.
  • LSTM에 주의 기반 기법을 통합함으로써 이미지 특징과 생성된 텍스트 간의 정렬이 향상되어 정확도가 향상된다.
  • 엔드 투 엔드 훈련 전략은 특징 추출과 시퀀스 생성을 함께 최적화하여 오류 전파를 줄인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.