Skip to main content
QUICK REVIEW

[논문 리뷰] Offline Handwritten Chinese Text Recognition with Convolutional Neural Networks

Brian Liu, Xianchao Xu|arXiv (Cornell University)|2020. 06. 28.
Handwritten Text Recognition Techniques참고 문헌 26인용 수 9
한 줄 요약

이 논문은 연결주의 시계열 분류(CTC) 손실을 사용하여 오프라인 수기 중화문 텍스트 인식을 위한 순환 구조가 없는 컨volutional 신경망(CNN) 기반 접근법을 제안한다. 고율 드롭아웃과 기존 문자 템플릿을 활용한 합성 데이터 증강 기법을 적용함으로써 언어 모델 보정 없이 ICDAR 2013 벤치마크에서 최고 성능을 기록한 6.81%의 문자 오류율(Character Error Rate, CER)을 달성한다.

ABSTRACT

Deep learning based methods have been dominating the text recognition tasks in different and multilingual scenarios. The offline handwritten Chinese text recognition (HCTR) is one of the most challenging tasks because it involves thousands of characters, variant writing styles and complex data collection process. Recently, the recurrent-free architectures for text recognition appears to be competitive as its highly parallelism and comparable results. In this paper, we build the models using only the convolutional neural networks and use CTC as the loss function. To reduce the overfitting, we apply dropout after each max-pooling layer and with extreme high rate on the last one before the linear layer. The CASIA-HWDB database is selected to tune and evaluate the proposed models. With the existing text samples as templates, we randomly choose isolated character samples to synthesis more text samples for training. We finally achieve 6.81% character error rate (CER) on the ICDAR 2013 competition set, which is the best published result without language model correction.

연구 동기 및 목표

  • 수천 개의 문자와 높은 스타일 변동성을 포함하는 오프라인 수기 중화문 텍스트 인식의 과제를 해결하기 위해.
  • 높은 병렬 처리 능력과 효율적인 훈련을 가능하게 하는 순환 구조가 없는 아키텍처를 개발하기 위해.
  • 제한된 수기 데이터로 훈련된 모델의 과적합을 줄이기 위해 전략적 드롭아웃 적용을 통해.
  • 기존 텍스트 템플릿을 활용한 합성 데이터 생성을 통해 일반화 능력을 향상시키기 위해.
  • 언어 모델 보정에 의존하지 않고 ICDAR 2013 벤치마크에서 최고 성능을 달성하기 위해.

제안 방법

  • 모델는 순환층을 완전히 제거하고 순수하게 컨볼루션 신경망만을 사용하여 고도로 병렬화된 훈련을 가능하게 한다.
  • 시퀀스에서 시퀀스로의 정렬을 명시적으로 제공하지 않더라도 처리할 수 있도록 연결주의 시계열 분류(CTC)를 손실 함수로 활용한다.
  • 각 최대 풀링 레이어 이후에 드롭아웃 레이어를 적용하며, 선형 분류기 이전의 최종 레이어에 매우 높은 드롭아웃 비율을 적용하여 과적합을 완화한다.
  • 기존 텍스트 샘플에서 고립된 문자를 무작위로 선택하여 새로운 문자 시퀀스를 구성함으로써 합성 훈련 샘플을 생성한다.
  • 모델 튜닝 및 평가에 CASIA-HWDB 데이터셋을 사용하여 중국어 수기 인식을 위한 대규모 기준 벤치마크를 제공한다.
  • 템플릿 기반 합성에 의한 데이터 증강은 훈련의 다양성을 증가시키고 모델의 강인성을 향상시킨다.

실험 결과

연구 질문

  • RQ1순수하게 컨볼루션 신경망 아키텍처가 순환 구성 요소 없이도 오프라인 수기 중화문 텍스트 인식에서 경쟁적인 성능을 달성할 수 있는가?
  • RQ2제한된 수기 중화문 데이터셋에서 최종 레이어에 적용된 고율 드롭아웃이 과적합을 얼마나 효과적으로 줄이는가?
  • RQ3기존 텍스트 템플릿에서 유도된 합성 데이터가 모델의 일반화 능력과 인식 정확도 향상에 얼마나 기여하는가?
  • RQ4CTC 손실 함수가 순수 CNN 아키텍처의 시퀀스 인식 작업을 위한 종단간(end-to-end) 훈련을 효과적으로 가능하게 하는가?
  • RQ5언어 모델 통합 없이 CNN 전용 CTC 기반 모델이 ICDAR 2013 벤치마크에서 달성할 수 있는 성능의 한계는 무엇인가?

주요 결과

  • 제안된 CNN 전용 모델은 ICDAR 2013 경쟁 테스트 세트에서 문자 오류율(Character Error Rate, CER) 6.81%를 기록하였으며, 언어 모델 보정 없이 보고된 바 중 최고의 성능이다.
  • 최종 최대 풀링 레이어 이후 고율 드롭아웃을 적용함으로써 제한된 훈련 데이터에서 과적합이 크게 감소한다.
  • 기존 텍스트 템플릿에서 유도된 합성 데이터 생성은 훈련의 다양성을 효과적으로 증가시키고 모델의 일반화 능력을 향상시킨다.
  • 순환 구조가 없는 아키텍처는 고도로 병렬화된 훈련을 가능하게 하며, RNN 기반 모델과 비교해도 경쟁적인 성능를 유지한다.
  • 모델는 수기 중화문 텍스트의 스타일 변동성과 복잡한 글쓰기 패턴에 대해 강력한 강인성을 보여준다.
  • 결과는 CTC 손실이 순수 CNN 아키텍처의 시퀀스 인식 작업을 위한 종단간 훈련에 효과적이라는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.