Skip to main content
QUICK REVIEW

[논문 리뷰] Handwriting recognition using Cohort of LSTM and lexicon verification with extremely large lexicon

Bruno Stuner, Clément Chatelain|arXiv (Cornell University)|2016. 12. 22.
Handwritten Text Recognition Techniques인용 수 5
한 줄 요약

이 논문은 Rimes 및 IAM 데이터셋에서 최신 기술 수준의 성능을 달성하기 위해 러닝 컨소시엄(LSTM) 네트워크와 어휘 검증을 조합한 새로운 수기 인식 프레임워크를 제안한다. 단일 실행에서 수백 개의 상호보완적 LSTM 네트워크를 훈련하고 빠른 단어 수준의 검증을 적용함으로써, 최소한의 계산 오버헤드로 300만 단어에 이르는 매우 큰 어휘를 지원하면서도 높은 정확도를 유지한다. 5,744개의 어휘로 Rimes에서 WER를 2.28%로 낮추었고, 327만 개의 어휘로는 8.04%의 WER를 기록하였다.

ABSTRACT

State-of-the-art methods for handwriting recognition are based on Long Short Term Memory (LSTM) recurrent neural networks (RNN), which now provides very impressive character recognition performance. The character recognition is generally coupled with a lexicon driven decoding process which integrates dictionaries. Unfortunately these dictionaries are limited to hundred of thousands words for the best systems, which prevent from having a good language coverage, and therefore limit the global recognition performance. In this article, we propose an alternative to the lexicon driven decoding process based on a lexicon verification process, coupled with an original cascade architecture. The cascade is made of a large number of complementary networks extracted from a single training (called cohort), making the learning process very light. The proposed method achieves new state-of-the art word recognition performance on the Rimes and IAM databases. Dealing with gigantic lexicon of 3 millions words, the methods also demonstrates interesting performance with a fast decision stage.

연구 동기 및 목표

  • 기존의 어휘 기반 디코딩 방식이 작은 어휘 크기(일般적으로 <20만 단어)와 높은 계산 비용으로 인해 제한되는 문제를 해결하기 위해.
  • 속도나 정확도를 희생시키지 않고 매우 큰 어휘(최대 300만 단어)를 효율적으로 처리할 수 있도록 하기 위해.
  • 빔 서치를 피하기 위해 어휘 검증과 최소 결정 일치 기반의 빠르고 확장 가능한 결정 메커니즘을 개발하기 위해.
  • 단일 훈련 실행으로 상호보완적인 LSTM 네트워크의 대규모 컨소시엄을 생성함으로써 훈련 오버헤드를 줄일 수 있도록 하기 위해.
  • 표준 벤치마크(Rimes 및 IAM)에서 최신 기술 수준의 단어 인식 성능를 달성하면서도 처리 시간을 최소화하기 위해.

제안 방법

  • 다중 LSTM 네트워크가 단일 모델에서 동시에 훈련되는 계단식 아키텍처를 사용하여, 가중치 공유와 기울기 업데이트를 활용해 상호보완적인 인식기들을 생성한다.
  • 2,100개의 LSTM 네트워크로 구성된 컨소시엄은 단일 훈련 프로세스에서 유도되며, 훈련 중에 효율적으로 다수의 네트워크를 추출할 수 있다는 이론적 통찰을 활용한다.
  • 단어 인식 결정은 어휘 검증을 통해 이루어지며, 가설은 어휘에 존재할 경우에만 수락되어 거짓 양성(false positives)을 크게 줄인다.
  • 컨소시엄 전반에 걸쳐 최소 결정 일치 수(MNDA) 규칙을 적용하여 추가로 거짓 수용을 줄이고 정밀도를 향상시킨다.
  • 시스템은 계단식으로 처리되며, 한 단어가 검증되고 수락되면 이후 네트워크로 전달되지 않아 평균 처리 시간을 줄인다.
  • 컨소시엄을 2,100개에서 118개로 잘라내어 평균 처리 시간을 729ms에서 197ms로 단축하면서도 높은 성능를 유지한다.

실험 결과

연구 질문

  • RQ1단일 훈련 실행으로 상호보완적인 LSTM 네트워크의 대규모 컨소시엄을 생성할 수 있으며, 이들이 함께 인식 성능를 향상시킬 수 있는가?
  • RQ2특히 매우 큰 어휘를 다룰 때, 어휘 검증 방식이 기존의 빔 서치 기반 어휘 기반 디코딩 방식보다 속도와 정확도 면에서 뛰어나지 않는가?
  • RQ3300만 단어 어휘로 확장해도 시스템이 높은 정확도와 낮은 처리 시간을 유지할 수 있는가?
  • RQ4성능 저하 없이 컨소시엄을 얼마나 잘라낼 수 있는가?
  • RQ5제안된 프레임워크는 Rimes 및 IAM과 같은 표준 수기 인식 벤치마크에서 최신 기술 수준의 성능를 달성할 수 있는가?

주요 결과

  • 5,744개의 어휘로 Rimes 데이터셋에서 단어 인식률(WRR) 92.96%와 단어 오류률(WER) 2.28%를 기록하여 이전 방법을 능가한다.
  • 327만 개의 어휘로 확장해도 WER 8.04%를 유지하여 어휘 크기 증가에 대한 강건성을 입증한다.
  • 단지 118개의 네트워크로 구성된 잘라낸 시스템은 WER 3.64%를 기록했으며(완전한 컨소시엄의 3.48% 대비), 처리 시간은 73% 감소하여 성능 손실가 최소한이다.
  • 처리 시간이 매우 효율적이다: 80%의 단어가 14개의 네트워크 이후 0.175초 이내로 처리되었고, 90%는 41개의 네트워크 이후 0.5초 이내로 처리되었다.
  • 어휘 검증은 심지어 대규모 어휘에서도 1회 검사당 1 마이크로초 이내로 작동하여 매우 확장 가능하고 빠른 성능를 보인다.
  • 최소한의 하이퍼파라미터 튜닝으로 Rimes 및 IAM 데이터셋에서 최신 기술 수준의 성능를 달성하였고, 다양한 어휘 크기에서 강력한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.