Skip to main content
QUICK REVIEW

[논문 리뷰] Candidate Fusion: Integrating Language Modelling into a Sequence-to-Sequence Handwritten Word Recognition Architecture

Lei Kang, Pau Riba|arXiv (Cornell University)|2019. 12. 21.
Handwritten Text Recognition Techniques참고 문헌 47인용 수 4
한 줄 요약

이 논문은 외부 언어 모델을 순서-순서 텍스트 인식 시스템에 통합하기 위한 새로운 방법인 Candidate Fusion을 제안한다. 이 방법은 인식기와 언어 모델을 함께 훈련시켜, 인식기의 출력과 언어 모델 예측을 동적으로 융합함으로써, 인식 오류에서 적응적으로 학습하고 공개 데이터셋과 실제 산업 응용 사례에서 최신 기술을 초월하는 성능을 달성한다.

ABSTRACT

Sequence-to-sequence models have recently become very popular for tackling handwritten word recognition problems. However, how to effectively integrate an external language model into such recognizer is still a challenging problem. The main challenge faced when training a language model is to deal with the language model corpus which is usually different to the one used for training the handwritten word recognition system. Thus, the bias between both word corpora leads to incorrectness on the transcriptions, providing similar or even worse performances on the recognition task. In this work, we introduce Candidate Fusion, a novel way to integrate an external language model to a sequence-to-sequence architecture. Moreover, it provides suggestions from an external language knowledge, as a new input to the sequence-to-sequence recognizer. Hence, Candidate Fusion provides two improvements. On the one hand, the sequence-to-sequence recognizer has the flexibility not only to combine the information from itself and the language model, but also to choose the importance of the information provided by the language model. On the other hand, the external language model has the ability to adapt itself to the training corpus and even learn the most commonly errors produced from the recognizer. Finally, by conducting comprehensive experiments, the Candidate Fusion proves to outperform the state-of-the-art language models for handwritten word recognition tasks.

연구 동기 및 목표

  • 다른 코퍼스에서 훈련된 순서-순서 손글씨 인식기와 외부 언어 모델을 통합하는 도전 과제를 해결한다.
  • 광학 인식 데이터와 언어 모델 훈련 데이터 간의 분포 편향으로 인한 성능 저하를 완화한다.
  • 공동 훈련 중에 언어 모델이 인식기의 일반적인 오류를 적응적으로 보완하고 수정할 수 있도록 한다.
  • 융합 가중치의 수동 초깃값 조정이 필요 없는 유연하고 훈련 가능한 융합 메커니즘을 개발한다.
  • 공개 벤치마크와 실제 산업 데이터셋 모두에서의 강건성과 일반화 능력을 입증한다.

제안 방법

  • 외부 언어 모델의 예측을 추가 입력 토큰 시퀀스로 삽입하는 훈련 가능한 융합 메커니즘인 Candidate Fusion을 제안한다.
  • 인식 데이터를 공유하여 순서-순서 모델과 외부 언어 모델을 함께 훈련함으로써 언어 모델이 인식기의 오류 패턴을 학습하고 수정할 수 있도록 한다.
  • 디코더 내의 어텐션 메커니즘을 활용해 시각적 특징과 언어 모델의 후보 번역 결과를 동적으로 참조한다.
  • 일반화 및 강건성을 향상시키기 위해 사전 훈련 단계에서 합성 손글씨 데이터와 데이터 증강 전략을 통합한다.
  • 디코딩 중 언어 모델 예측의 영향력을 제어하기 위해 학습 가능한 융합 게이트 또는 어텐션 기반 가중치를 적용한다.
  • 성능 평가를 위해 제약된 어휘 조건 하에서 에디트 거리 기반 어휘 제약 조건을 부가 분석에서 사용한다.
Figure 10: A cropped area of the real industrial use case dataset.
Figure 10: A cropped area of the real industrial use case dataset.

실험 결과

연구 질문

  • RQ1순서-순서 인식기와 외부 언어 모델을 함께 훈련시켜, 코퍼스 불일치로 인한 성능 저하를 줄일 수 있는가?
  • RQ2Recognition 정확도와 강건성 측면에서 Candidate Fusion은 얕은 융합 및 깊은 융합 기반 모델과 비교해 어떻게 성능을 내는가?
  • RQ3훈련 과정에서 언어 모델이 인식기에서 발생하는 일반적인 오류를 얼마나 잘 적응하고 수정할 수 있는가?
  • RQ4복잡하고 노이즈가 많은 손글씨 양식을 포함한 실제 산업 데이터셋에서도 제안된 방법이 일반화되는가?
  • RQ5폐쇄형 어휘에 의존하지 않고도 Candidate Fusion이 최신 기술을 초월할 수 있는가?

주요 결과

  • IAM 데이터셋에서 CER은 5.79에서 5.74로 감소하고, GW 데이터셋에서는 2.82에서 2.52로 감소하여 얕은 융합 및 깊은 융합 기반 모델을 모두 능가한다.
  • Rimes 데이터셋에서 Candidate Fusion은 CER 2.32와 WER 7.47을 달성하여 기준 모델(CER 2.65, WER 8.71)과 다른 융합 방법보다 유의미하게 뛰어난 성능을 보였다.
  • 폐쇄형 어휘 조건 하에서 Rimes에서 Candidate Fusion은 CER 1.45를 기록했으며(시험 세트 어휘만 사용), 기준 모델 대비 오류율을 40% 이상 감소시켰다.
  • 자동차 사고 진술서 양식을 포함한 실제 산업 응용 사례에서 Candidate Fusion은 CER 3.7과 WER 4.5를 달성하여 강력한 CTC 기반 기준 모델(CER 5.6, WER 7.4)을 능가했다.
  • 부가 분석 결과, 언어 모델과 함께 공동 훈련을 수행할 경우 오류 보정 능력과 일반화 능력이 향상되며, 특히 인식기 전용 오류에 적응된 언어 모델일수록 그 효과가 뚜렷하다.
Candidate Fusion: Integrating Language Modelling into a Sequence-to-Sequence Handwritten Word Recognition Architecture

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.