Skip to main content
QUICK REVIEW

[논문 리뷰] What If We Only Use Real Datasets for Scene Text Recognition? Toward Scene Text Recognition With Fewer Labels

Jeonghun Baek, Yusuke Matsui|arXiv (Cornell University)|2021. 03. 07.
Handwritten Text Recognition Techniques참고 문헌 72인용 수 6
한 줄 요약

이 논문은 시나리오 텍스트 인식(STR) 모델이 대량의 합성 데이터셋을 필요로 한다는 일반적인 믿음을 도전하며, 오직 실존하는 공개된 레이블 데이터만을 사용하여 최신 기술 수준의 성능을 달성할 수 있음을 보여준다. 최근의 벤치마크 데이터셋들에서 유래한 276만 개의 실존 레이블 데이터 샘플을 통합하고, 단순한 데이터 증강 및 자기지도 학습 기법을 적용함으로써, 합성 데이터 없이도 경쟁 가능한 정확도를 달성하였으며, 이는 오직 실존 레이블 데이터로만 훈련된 첫 번째 성공적인 STR 시스템이다.

ABSTRACT

Scene text recognition (STR) task has a common practice: All state-of-the-art STR models are trained on large synthetic data. In contrast to this practice, training STR models only on fewer real labels (STR with fewer labels) is important when we have to train STR models without synthetic data: for handwritten or artistic texts that are difficult to generate synthetically and for languages other than English for which we do not always have synthetic data. However, there has been implicit common knowledge that training STR models on real data is nearly impossible because real data is insufficient. We consider that this common knowledge has obstructed the study of STR with fewer labels. In this work, we would like to reactivate STR with fewer labels by disproving the common knowledge. We consolidate recently accumulated public real data and show that we can train STR models satisfactorily only with real labeled data. Subsequently, we find simple data augmentation to fully exploit real data. Furthermore, we improve the models by collecting unlabeled data and introducing semi- and self-supervised methods. As a result, we obtain a competitive model to state-of-the-art methods. To the best of our knowledge, this is the first study that 1) shows sufficient performance by only using real labels and 2) introduces semi- and self-supervised methods into STR with fewer labels. Our code and data are available: https://github.com/ku21fan/STR-Fewer-Labels

연구 동기 및 목표

  • 실존 데이터가 고성능의 시나리오 텍스트 인식(STR) 모델을 훈련시키기에 부족하다는 널리 퍼진 믿음을 도전하기 위해.
  • 최근에 축적된 공개된 실존 데이터셋들이 이제 오직 실존 레이블만을 사용하여 경쟁 가능한 성능을 내는 STR 모델 훈련을 가능하게 한다는 것을 보여주기 위해.
  • 제한된 실존 레이블 데이터에서 최고의 성능을 내기 위해 효과적인 데이터 증강 및 자기지도 학습 기법을 개발하기 위해.
  • 반감독 및 자기지도 학습 프레임워크에서 실존 데이터와 비레이블 데이터를 조합할 경우의 효과를 평가하기 위해.
  • 합성 데이터를 생성하기 어려운 분야(예: 수기 텍스트 또는 예술적 텍스트)를 위한 새로운 기준을 설정하기 위해, 레이블 수를 줄인 STR에 대해.

제안 방법

  • 2011년에서 2019년 사이의 실존 레이블 데이터셋을 통합하며, SVT, IIIT5K, IC13, IC15, CUTE80, COCO-Text, RCTW, Uber-Text, ArT, LSVT, MLT19, ReCTS 및 기타 데이터셋을 포함하여 총 276만 개의 샘플을 확보한다.
  • 실존 훈련 데이터의 다양성과 강건성을 높이기 위해 단순하지만 효과적인 데이터 증강 기법을 적용한다.
  • 비레이블 데이터를 수집하고 반감독 학습 프레임워크에서 사용하여 모델의 일반화 능력을 향상시킨다.
  • 자기지도 학습을 도입하여 비레이블 데이터를 활용하고, 추가적인 레이블 없이도 특징 학습을 향상시킨다.
  • CRNN 및 TRBA 등의 모델을 사용하여 표준 STR 벤치마크에서 평가하며, 기여 요소를 분리하기 위해 분석 실험을 실시한다.
  • 합성 데이터와 실존 데이터를 모두 사용하는 하이브리드 설정에서도 프레임워크를 테스트하여 이식 가능성 여부를 평가한다.
Figure 1 : Accuracy vs. number of accumulated real labeled data. Every two years, public real data has been accumulated. In our experiments, we find that accuracy obtained using real data approaches that obtained using synthetic data, along with increment of real data. CRNN [ CRNN ] and TRBA [ TRBA
Figure 1 : Accuracy vs. number of accumulated real labeled data. Every two years, public real data has been accumulated. In our experiments, we find that accuracy obtained using real data approaches that obtained using synthetic data, along with increment of real data. CRNN [ CRNN ] and TRBA [ TRBA

실험 결과

연구 질문

  • RQ1합성 데이터에 의존하지 않고 오직 실존 레이블 데이터만을 사용하여 시나리오 텍스트 인식 모델이 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2합성 데이터셋에 대량으로 훈련된 모델과 비교해 볼 때, 오직 실존 데이터로만 훈련된 STR 모델의 성능는 어떠한가?
  • RQ3제한된 실존 레이블 데이터에서 STR 성능을 향상시키기 위해 가장 효과적인 데이터 증강 및 자기지도 학습 기법은 무엇인가?
  • RQ4반감독 및 자기지도 학습 프레임워크에서 비레이블 데이터를 사용할 경우, STR 모델의 성능 향상에 상당한 기여를 할 수 있는가?
  • RQ5제안된 실존 데이터 전용 접근 방식은 합성 데이터가 확보되지 않거나 실용적이지 않은 상황에서도 이식 가능하고 효과적인가?

주요 결과

  • 통합된 실존 데이터셋(276만 개 샘플)을 통해 STR 모델은 1600만 개의 합성 샘플로 훈련된 모델과 유사한 성능을 달성할 수 있다.
  • 데이터 증강 기법은 실존 데이터로만 훈련된 STR 모델의 일반화 능력과 강건성을 크게 향상시킨다.
  • 자기지도 학습 및 반감독 학습 기법은 비레이블 데이터를 효과적으로 활용하여 실존 데이터 기반 성능을 추가로 향상시킨다.
  • 제안된 실존 데이터 전용 접근 방식은 합성 데이터에 의존하는 최신 기술 수준의 방법들과 비교해도 경쟁 가능한 결과를 도출한다.
  • 최근의 데이터 축적을 고려할 때, 실존 데이터가 부족하다는 일반적인 믿음은 더 이상 타당하지 않음을 본 연구는 입증한다.
  • 하이브리드 설정에서도 이 방법은 효과적이며, 실존 데이터와 합성 데이터를 모두 사용할 경우 뛰어난 성능을 보인다.
(a) MJ word boxes
(a) MJ word boxes

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.