Skip to main content
QUICK REVIEW

[논문 리뷰] Learning to Read by Spelling: Towards Unsupervised Text Recognition

Ankush Gupta, Andrea Vedaldi|arXiv (Cornell University)|2018. 09. 23.
Handwritten Text Recognition Techniques참고 문헌 67인용 수 4
한 줄 요약

이 논문은 쌍화된 이미지-텍스트 애너테이션 없이도, 예측된 텍스트 문자열을 비쌍화된 문장 집합의 통계적으로 타당한 문자열과 대조시켜, 적대적 훈련을 통해 문자 식별을 암묵적으로 학습하는 비지도 텍스트 인식 방법을 제안한다. 이 방법은 쌍화되지 않은 이미지와 텍스트 문자열만을 사용하여 실제 역사적 책 스캔에서 96.2%의 문자 정확도와 84.8%의 단어 정확도를 달성하며, 비균일한 간격에 대한 강건성과 뛰어난 일반화 능력을 입증한다.

ABSTRACT

This work presents a method for visual text recognition without using any paired supervisory data. We formulate the text recognition task as one of aligning the conditional distribution of strings predicted from given text images, with lexically valid strings sampled from target corpora. This enables fully automated, and unsupervised learning from just line-level text-images, and unpaired text-string samples, obviating the need for large aligned datasets. We present detailed analysis for various aspects of the proposed method, namely - (1) impact of the length of training sequences on convergence, (2) relation between character frequencies and the order in which they are learnt, (3) generalisation ability of our recognition network to inputs of arbitrary lengths, and (4) impact of varying the text corpus on recognition accuracy. Finally, we demonstrate excellent text recognition accuracy on both synthetically generated text images, and scanned images of real printed books, using no labelled training examples.

연구 동기 및 목표

  • 쌍화된 이미지-텍스트 애너테이션 없이도 작동하는 텍스트 인식 시스템을 개발하여, 감독 학습 데이터 수집의 높은 비용 문제를 해결한다.
  • 예측 문자열을 타당한 언어 통계와 매칭함으로써 철자를 올바르게 배우는 것이 암묵적으로 정확한 텍스트 인식을 가능하게 할 수 있는지 조사한다.
  • 이 방법의 임의의 길이의 입력 및 다양한 텍스트 집합(예: '전쟁과 평화'와 같은 관련 없는 도메인 포함)에 대한 일반화 능력을 평가한다.
  • 비균일한 간격과 변동 폭의 폰트를 가진 실제 도서 스캔과 같은 어려운 실세계 데이터에서의 뛰어난 성능을 입증한다.

제안 방법

  • 이 방법은 이미지에서 예측된 문자열의 조건부 분포를 목표 텍스트 집합에서 샘플링한 타당한 문자열의 분포와 대조시키는 방식으로 텍스트 인식 문제를 설정하며, 적대적 훈련을 사용한다.
  • 완전 컨volution 네트워크가 입력 이미지에서 문자 시퀀스를 예측하고, 디세크리미네이터는 예측 문자열이 실제 언어의 통계적 특성(예: n-gram, 빈도)을 충족하는지 확인한다.
  • 생성자(인식 네트워크)가 디세크리미네이터가 실제 타당한 텍스트와 구분할 수 없도록 하는 문자열을 생성함으로써, GAN 유사 목적함수를 사용해 엔드 투 엔드로 모델을 훈련한다.
  • 실제 스캔된 책에서 비균일한 간격과 가변 폭의 폰트를 처리하기 위해, 인식 네트워크의 최종 레이어에 스킵-RNN을 추가하여 컨volution 특징에 잔여 업데이트를 제공한다.
  • 훈련 과정은 쌍화되지 않은 데이터만 사용한다: 이미지-라인 쌍과 별개로 쌍화되지 않은 텍스트 문자열 집합이며, 정렬 또는 수동 애너테이션의 필요성을 제거한다.
  • 문자 식별은 언어 제약 조건을 통해 암묵적으로 학습되며, 높은 빈도의 문자는 먼저 학습되고, 낮은 빈도의 문자(예: 'z')는 나중에 학습된다.

실험 결과

연구 질문

  • RQ1타당한 텍스트의 통계적 특성에만 의존하여, 쌍화된 이미지-텍스트 학습 데이터 없이도 텍스트 인식을 달성할 수 있는가?
  • RQ2훈련 시퀀스의 길이가 수렴과 인식 성능에 어떤 영향을 미치는가?
  • RQ3텍스트 집합 내 문자의 빈도가 문자 학습의 순서와 품질에 영향을 미치는가?
  • RQ4한 길이의 텍스트에서 훈련된 모델이 상당히 다른 길이의 입력으로 일반화 가능한가?
  • RQ5특히 이미지 내용과 관련 없는 텍스트 집합(예: 톨스토이의 '전쟁과 평화')을 선택할 경우, 인식 정확도에 어떤 영향을 미치는가?

주요 결과

  • 모델은 비쌍화된 이미지 및 텍스트 데이터만으로 훈련한 후, 합성 텍스트 이미지에서 99%의 문자 정확도와 95%의 단어 정확도를 달성한다.
  • 비균일한 간격을 가진 실제 스캔된 책 이미지에서, 스킵-RNN이 강화된 모델은 단어 정확도를 45.0%에서 84.8%로, 문자 정확도를 85.6%에서 96.2%로 향상시킨다.
  • 문자 학습 순서는 문자 빈도와 강하게 상관된다: 'to'와 'it'과 같은 공통 단어는 빨리 학습되고, 'v'와 'w'와 같은 희귀 문자는 나중에 학습된다.
  • 모델은 임의의 길이의 입력으로 잘 일반화되며, 3에서 48자 사이의 시퀀스에서도 높은 성능을 유지한다. 이는 오직 24자 시퀀스에서만 훈련된 경우에도 마찬가지다.
  • 이미지 내용과 관련 없는 집합(예: WMT 뉴스크롤)을 사용할 경우 단어 정확도는 92.53%로 감소하지만, 관련 있는 집합(예: WMT 뉴스크롤)을 사용할 경우 거의 최적의 성능(~95%)을 유지한다.
  • 혼동 행렬은 오직 희귀 문자인 'z'와 같은 문자들이 일관되게 잘못 분류되는 것으로 나타나, 비록 비지도 설정이지만 희귀 문자는 여전히 도전 과제로 남아 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.