Skip to main content
QUICK REVIEW

[논문 리뷰] StackMix and Blot Augmentations for Handwritten Text Recognition

Alex Shonenkov, Denis Karachev|arXiv (Cornell University)|2021. 08. 26.
Handwritten Text Recognition Techniques참고 문헌 24인용 수 11
한 줄 요약

이 논문은 IAM, Bentham, Saint Gall, Digital Peter, HKR를 포함한 여러 벤치마크 데이터셋에서 최신 기술을 초월하는 성능을 보이는 새로운 수작업 텍스트 인식(HTR) 시스템을 제안한다. 이 방법은 수정된 ResNet-34 백본과 두 가지 데이터 증강 기법—수작업 블롯(Handwritten Blots)은 획자리 텍스트를 시뮬레이션하고, StackMix는 인쇄체와 수작업 텍스트를 혼합하여 합성 학습 샘플을 생성하는 방식으로, BenthamR0에서 새로운 SOTA CER 1.73%와 Saint Gall에서 3.65%를 달성한다.

ABSTRACT

This paper proposes a handwritten text recognition(HTR) system that outperforms current state-of-the-artmethods. The comparison was carried out on three of themost frequently used in HTR task datasets, namely Ben-tham, IAM, and Saint Gall. In addition, the results on tworecently presented datasets, Peter the Greats manuscriptsand HKR Dataset, are provided.The paper describes the architecture of the neural net-work and two ways of increasing the volume of train-ing data: augmentation that simulates strikethrough text(HandWritten Blots) and a new text generation method(StackMix), which proved to be very effective in HTR tasks.StackMix can also be applied to the standalone task of gen-erating handwritten text based on printed text.

연구 동기 및 목표

  • 전문가가 주석을 달기 위해 오랜 시간과 비용이 소요되는 역사적 수작업 문서 인식에서 레이블이 부족한 문제를 해결한다.
  • 학습 데이터의 다양성과 강건성을 향상시켜 저자원 및 역사적으로 다양성이 큰 수작업 텍스트 데이터셋에서 인식 정확도를 향상시킨다.
  • 대규모 역사적 문건을 효율적으로 처리할 수 있는 확장 가능한 HTR 시스템을 개발하여 수동 해독에 대한 의존도를 줄인다.
  • 추가 주석이 필요 없이 실제 수작업 텍스트 결함을 시뮬레이션하는 데이터 증강 기법을 도입하여 모델의 일반화 능력을 향상시킨다.
  • 최근 및 특수 컬렉션인 피터 대왕의 문건과 HKR를 포함한 여러 벤치마크 데이터셋에서 최신 기술 성능을 달성한다.

제안 방법

  • 공간 해상도를 유지하기 위해 첫 번째 레이어에서 스트라이드-1 컨볼루션을 사용하는 수정된 ResNet-34 아키텍처를 채택하고, AdaptiveAvgPool2d와 세 개의 BiLSTM 레이어를 통해 시퀀스 모델링을 수행한다.
  • Handwritten Blots—수작업 선에 현실적인 잉크 반점 아티팩트를 적용하여 획자리 텍스트를 시뮬레이션하는 데이터 증강 방법으로, 잉크 결함에 대한 강건성을 향상시킨다.
  • StackMix—학습된 혼합 전략을 사용하여 인쇄체 텍스트와 수작업 이미지를 혼합하여 합성 학습 샘플을 생성하는 새로운 증강 기법으로, 학습 데이터 다양성을 효과적으로 증가시킨다.
  • 시퀀스 간 직접 최적화가 가능한 엔드 투 엔드 시퀀스-투-시퀀스 학습을 위해 CTC 손실을 사용하여 모델을 훈련시킨다.
  • 128×2048 픽셀 이미지를 처리하는 라인 수준의 인식 설정에서 모델을 적용하고, 표준 평가 지표인 CER, WER 및 정확도를 사용해 평가한다.
  • 특히 IAM에서 여러 가지 데이터 분할이 존재하므로, 이전 연구와의 공정한 비교를 위해 실험 전반에 걸쳐 일관된 데이터 분할을 사용한다.

실험 결과

연구 질문

  • RQ1StackMix와 Handwritten Blots와 같은 합성 데이터 증강 기법이 저자원 및 역사적 수작업 텍스트 데이터셋에서 HTR 성능을 크게 향상시킬 수 있는가?
  • RQ2StackMix와 Handwritten Blots의 조합이 다양한 데이터셋에서 표준 데이터 증강 및 기준 모델 대비 CER 및 WER 측면에서 어떻게 비교되는가?
  • RQ3최소한의 레이블 데이터로도 대규모 역사적 문건에서 고정확도 추론을 가능하게 함으로써, 제안된 시스템이 수동 주석 달기 비용을 얼마나 줄일 수 있는가?
  • RQ4IAM, Bentham, Saint Gall에서의 결과를 바탕으로, 현대 및 역사적 스크립트를 포함한 다양한 수작업 스타일과 언어에 대해 모델이 잘 일반화되는가?
  • RQ5특히 복잡한 증강 기법을 훈련 시 사용할 경우, 제안된 시스템의 추론 속도는 기존 모델과 비교해 어떻게 되는가?

주요 결과

  • 제안된 모델은 BenthamR0 데이터셋에서 기존 방법들(예: [11]에서 3.98%)을 크게 능가하는 새로운 SOTA CER 1.73% ± 0.02를 달성했으며, 2016년 SOTA 모델의 3.5% CER에 가까워졌다.
  • IAM-B 데이터셋에서 모델은 3.77% CER와 12.8% WER를 기록했으며, 2016년 SOTA 모델의 3.5% CER에 매우 가까운 성능을 보여, 널리 사용되는 벤치마크에서 강력한 성능을 입증했다.
  • Saint Gall 데이터셋에서 모델은 3.65% CER를 달성했으며, 이는 이전 최고 성능인 5.26% CER를 뛰어넘었고, 매우 다양성이 큰 역사적 스크립트에 대한 강력한 일반화 능력을 보였다.
  • 모든 증강 기법(StackMix + Blots + 표준 증강)의 조합은 BenthamR0에서 CER를 1.73%로, Saint Gall에서 3.65%로 낮추어, 다중 증강 전략이 상호 보완적인 개선 효과를 낳음을 시사한다.
  • 단일 Tesla V100 GPU에서 모델은 95라인/초의 추론 속도를 기록하여 분당 380페이지의 자동 처리가 가능하다—이것은 수백 페이지를 처리하는 데 3개월이 소요되는 수동 역사학자 팀에 비해 극적으로 빠른 속도이다.
  • Digital Peter 데이터셋에서 모델은 2.50% CER와 14.6% WER를 기록했으며, 이는 이전 SOTA의 10.5% CER를 뛰어넘어 희귀하고 복잡한 역사적 스크립트에 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.