Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting Scene Text Recognition: A Data Perspective

Qing Jiang, Jiapeng Wang|arXiv (Cornell University)|2023. 07. 17.
Handwritten Text Recognition Techniques인용 수 4
한 줄 요약

이 논문은 데이터 중심적 시각에서 시점 텍스트 인식(STR)을 재평가하며, 표준 벤치마크에서 정확도가 포화 상태에 이르렀음에도 불구하고 데이터 분포 이탈으로 인해 실제 환경에서의 성능은 여전히 열악하다는 점을 드러낸다. 400만 장의 레이블이 부여된 이미지와 1000만 장의 레이블이 없는 이미지를 포함한 대규모 실세계 데이터셋인 Union14M을 도입함으로써 일곱 가지 열린 과제를 규명하고, 레이블이 없는 데이터에 대해 자기지도 학습을 통해 사전 훈련하면 STR의 강인성이 크게 향상됨을 보여주며, 비전 트랜스포머 기반 모델(MAERec)을 통해 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

This paper aims to re-assess scene text recognition (STR) from a data-oriented perspective. We begin by revisiting the six commonly used benchmarks in STR and observe a trend of performance saturation, whereby only 2.91% of the benchmark images cannot be accurately recognized by an ensemble of 13 representative models. While these results are impressive and suggest that STR could be considered solved, however, we argue that this is primarily due to the less challenging nature of the common benchmarks, thus concealing the underlying issues that STR faces. To this end, we consolidate a large-scale real STR dataset, namely Union14M, which comprises 4 million labeled images and 10 million unlabeled images, to assess the performance of STR models in more complex real-world scenarios. Our experiments demonstrate that the 13 models can only achieve an average accuracy of 66.53% on the 4 million labeled images, indicating that STR still faces numerous challenges in the real world. By analyzing the error patterns of the 13 models, we identify seven open challenges in STR and develop a challenge-driven benchmark consisting of eight distinct subsets to facilitate further progress in the field. Our exploration demonstrates that STR is far from being solved and leveraging data may be a promising solution. In this regard, we find that utilizing the 10 million unlabeled images through self-supervised pre-training can significantly improve the robustness of STR model in real-world scenarios and leads to state-of-the-art performance.

연구 동기 및 목표

  • 기존의 벤치마크가 해결된 문제를 나타낸다는 가정을 도전함으로써 현재의 시점 텍스트 인식(STR) 상태를 재평가하는 것.
  • 기존 STR 벤치마크의 한계를 규명함으로써, 단순성과 실제 세계의 복잡성 부족으로 인해 성능 포화 상태에 이르게 된 이유를 밝히는 것.
  • 지속적인 실세계 STR 시나리오 과제를 드러내기 위해 대규모 실세계 중심의 데이터셋(Union14M)을 구축하는 것.
  • 일곱 가지 신규로 규명된 실세계 과제에 대해 체계적으로 평가할 수 있도록 여덟 개의 서브셋을 포함한 과제 중심의 벤치마크를 개발하는 것.
  • 특히 거대한 레이블이 없는 데이터에서 자기지도 학습 사전 훈련을 통해 실세계 환경에서의 STR 강인성을 향상시키는 데이터 중심 솔루션을 탐색하는 것.

제안 방법

  • 17개의 공개 자료에서 유래한 400만 장의 레이블이 부여된 이미지(Union14M-L)와 1000만 장의 레이블이 없는 이미지(Union14M-U)를 포함하는 대규모 실세계 STR 데이터셋인 Union14M을 통합하였다.
  • Union14M-L에서 13개의 대표적인 STR 모델을 평가한 결과, 표준 벤치마크(87.03%) 대비 정확도가 크게 하락(66.53%)하여 데이터 분포 이탈 문제를 시사하였다.
  • STR 분야에서의 일곱 가지 열린 과제를 규명하였다: 곡선 텍스트, 다중 방향 텍스트, 맥락 없는 텍스트, 예술적 텍스트, 다중 단어 텍스트, 주목할 만한 텍스트, 완전하지 않은 텍스트.
  • Union14M-L에서 일반 샘플 40만 개와 과제 전용 샘플 9,383개를 활용해 과제 중심의 벤치마크를 구축하여 대상별 평가를 가능하게 하였다.
  • Union14M-U에서 자기지도 학습을 통해 마스크된 이미지 모델링 사전 훈련을 활용해 강인한 시각-텍스트 표현을 학습하는 비전 트랜스포머 기반 STR 모델인 MAERec을 제안하였다.
  • 사전 훈련 후 Union14M-L에서 MAERec을 미세조정함으로써 표준 벤치마크와 새로운 과제 중심 벤치마크 양쪽에서 최신 기술 수준의 성능을 달성하였다.
Figure 1: Average accuracy of STR models on six commonly used benchmarks as reported in their original papers. Models are trained with synthetic data.
Figure 1: Average accuracy of STR models on six commonly used benchmarks as reported in their original papers. Models are trained with synthetic data.

실험 결과

연구 질문

  • RQ1관측된 성능 포화 상태를 고려할 때, 현재의 STR 벤치마크가 실제로 실세계 과제를 얼마나 잘 반영하고 있는가?
  • RQ2실세계의 복잡한 상황에서 배포될 때 최신 기술 수준의 STR 모델들이 나타내는 주요 실패 원인은 무엇인가?
  • RQ3합성 데이터에서 훈련된 STR 모델의 성능은 대규모 실세계 데이터셋인 Union14M에서 어떻게 저하되는가?
  • RQ4기존 연구에서 다루지 못한 실세계 텍스트 인식 과제는 무엇이며, 어떻게 체계적으로 평가할 수 있는가?
  • RQ5거대한 실세계 레이블이 없는 이미지에서 자기지도 학습 사전 훈련이 STR의 일반화 및 강인성 향상에 상당한 기여를 할 수 있는가?

주요 결과

  • 표준 벤치마크에서의 정확도 포화 상태(평균 87.03%)는 실세계 성능 저하를 가리키며, Union14M-L에서 STR 모델의 정확도는 뿐만 아니라 실세계에서의 성능 저하를 암시한다.
  • 벤치마크 이미지 중 13개의 모델 중 어느 하나에서도 잘못 인식되는 비율은 2.91%에 불과하지만, 인간이 인식할 수 없는 샘플을 제외하면 이 비율은 1.53%로 떨어지며, 현재의 벤치마크에서의 향상 여지가 극히 미미함을 시사한다.
  • 13개의 모델은 일곱 가지의 실세계 과제에서 실패한다: 곡선 텍스트, 다중 방향 텍스트, 맥락 없는 텍스트, 예술적 텍스트, 다중 단어 텍스트, 주목할 만한 텍스트, 완전하지 않은 텍스트.
  • 제안된 과제 중심의 벤치마크는 실세계 데이터를 활용한 미세조정 후에도 현재의 SOTA 모델이 평균 74.6%의 정확도를 기록함으로써, 실세계 환경에서 STR가 여전히 해결되지 않은 문제임을 확인한다.
  • Union14M-U의 1000만 장의 레이블이 없는 이미지에서 자기지도 학습 사전 훈련을 통해 STR 모델의 정확도가 Union14M-Benchmark에서 5.1% 향상되었으며, MAERec를 통해 최신 기술 수준의 성능을 달성하였다(비전 트랜스포머 기반 기준 ViT-Base로 표준 벤치마크에서 96.2%).
  • MAERec는 더 적은 데이터를 사용했음에도 불구하고 다른 자기지도 학습 STR 방법보다 뛰어난 성능을 보이며, 자기지도 학습 사전 훈련에서 데이터 품질과 분포의 중요성을 강조한다.
Figure 2: Error analysis on the six STR benchmarks.
Figure 2: Error analysis on the six STR benchmarks.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.