Skip to main content
QUICK REVIEW

[논문 리뷰] TextScanner: Reading Characters in Order for Robust Scene Text Recognition

Zhaoyi Wan, Minghang He|arXiv (Cornell University)|2019. 12. 28.
Handwritten Text Recognition Techniques참고 문헌 34인용 수 12
한 줄 요약

TextScanner는 문자 분류와 기하적 위치 및 순서 예측을 분리하는 이중 브랜치, 분할 기반 프레임워크를 제안하여 강력한 스트리트 텍스트 인식을 구현한다. 분류와 기하학적 정보(위치/순서)를 별도의 브랜치로 처리하고, 요소별 곱셈을 통해 예측을 융합함으로써 정확한 문자 순서 보장과 동시에 주의 집중 이탈 및 분할 임계값 오류를 감소시킨다. 이로 인해 MLT-17에서 64.1%의 정확도와 0.75의 정규화된 에디트 거리(NED)를 달성하며, 이는 이전 최고 성능 모델들을 능가한다.

ABSTRACT

Driven by deep learning and the large volume of data, scene text recognition has evolved rapidly in recent years. Formerly, RNN-attention based methods have dominated this field, but suffer from the problem of extit{attention drift} in certain situations. Lately, semantic segmentation based algorithms have proven effective at recognizing text of different forms (horizontal, oriented and curved). However, these methods may produce spurious characters or miss genuine characters, as they rely heavily on a thresholding procedure operated on segmentation maps. To tackle these challenges, we propose in this paper an alternative approach, called TextScanner, for scene text recognition. TextScanner bears three characteristics: (1) Basically, it belongs to the semantic segmentation family, as it generates pixel-wise, multi-channel segmentation maps for character class, position and order; (2) Meanwhile, akin to RNN-attention based methods, it also adopts RNN for context modeling; (3) Moreover, it performs paralleled prediction for character position and class, and ensures that characters are transcripted in correct order. The experiments on standard benchmark datasets demonstrate that TextScanner outperforms the state-of-the-art methods. Moreover, TextScanner shows its superiority in recognizing more difficult text such Chinese transcripts and aligning with target characters.

연구 동기 및 목표

  • RNN-attention 기반의 스트리트 텍스트 인식 모델에서 발생하는 주의 집중 이탈 문제를 해결하기 위해.
  • 정성 분할 기반 방법에서 발생하는 분할 임계값 문제로 인한 과도한 또는 부족한 분할 문제를 해결하기 위해.
  • 특히 곡선, 기울어진, 중국어 텍스트와 같은 도전적인 텍스트에 대한 인식 강건성을 향상시키기 위해.
  • 추론 과정에서 명시적 순서 감독을 통해 정확한 문자 순서 보장을 보장하기 위해.
  • 분류 브랜치와 기하학적 브랜치 간 상호 감독을 통해 일반화 능력을 향상시키기 위해.

제안 방법

  • TextScanner는 이중 브랜치 아키텍처를 사용한다: 하나의 브랜치는 다중 채널 분할 맵을 통해 문자 클래스 확률을 예측한다.
  • 두 번째 브랜치는 전용 기하학적 맵을 사용하여 문자의 위치와 순서를 예측하며, 순서는 별도의 채널에 인코딩된다.
  • 문자 인스턴스는 분류 맵과 기하학적 맵을 요소별 곱셈으로 융합한 후, 각 채널에 대해 argmax를 적용하여 (위치, 순서, 클래스)를 추출한다.
  • 학습 과정에서 기하학적 감독이 분류 성능 향상에 기여하고, 반대로 분류 감독이 기하학적 예측을 향상시키는 상호 감독 메커니즘을 활용한다.
  • 합성 데이터 생성 파이프라인을 활용하여 SynthText를 사용해 다양한 텍스트 레이아웃에서 사전 학습을 수행하고, 실제 데이터에서 미세 조정한다.
  • 분류에 대해 교차 엔트로피 손실, 기하학적 위치 및 순서 예측에 대해 L1 손실을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.

실험 결과

연구 질문

  • RQ1분할 기반 방법이 추론 중 주의 집중 이탈 문제를 다루는 데 있어 RNN-attention 모델보다 더 뛰어난 강건성을 확보할 수 있는가?
  • RQ2기하학적 브랜치에서 명시적 순서 감독이 임계값 기반 연결 성분 검출로 인한 오류를 감소시키는가?
  • RQ3분류와 기하학적 예측을 분리함으로써 곡선 또는 중국어 텍스트와 같은 비정상적이고 복잡한 텍스트에서의 성능에 어떤 영향을 미치는가?
  • RQ4분류 브랜치와 기하학적 브랜치 간의 상호 감독이 얼마나 정확도 향상에 기여하는가?
  • RQ5다양한 형태와 외관을 가진 실제 스트리트 텍스트에 대해 모델이 효과적으로 일반화할 수 있는가?

주요 결과

  • TextScanner는 MLT-17 벤치마크에서 64.1%의 정확도와 0.75의 정규화된 에디트 거리(NED)를 달성하며, CRNN(59.2% 정확도, 0.68 NED)과 ASTER(57.4% 정확도, 0.69 NED)를 능가한다.
  • IC13에서 TextScanner는 위치 정확도가 뚜렷이 높으며, 실제값과 0.1 이내의 정규화된 거리 내에 예측된 비율이 62.3%로, 주목적 기반 모델보다 높은 성능을 보였다.
  • 제거 분석 결과, 기하학적 브랜치만으로도 IIIT에서 0.6%, SVT에서 0.9%, IC13에서 3.1%의 정확도 향상이 이루어져 그 효과를 입증했다.
  • 순서 맵의 포함으로 IC15에서 1.4%, SVTP에서 2.5%의 성능 향상이 있었으며, 이는 비정상적 텍스트에서 뚜렷한 성과 향상을 의미한다.
  • 상호 감독 메커니즘이 합성 데이터에서 사전 학습 후 실제 데이터로의 미세 조정 과정에서 특히 우수한 일반화 성능을 발휘했다.
  • 임계값 의존도를 피하기 위해 분할 기반의 임계값 오류를 줄였으며, 도전적인 데이터셋에서의 정량적·정성적 결과를 통해 이를 검증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.