Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting Classification Perspective on Scene Text Recognition

Hongxiang Cai, Jun Sun|arXiv (Cornell University)|2021. 02. 22.
Handwritten Text Recognition Techniques참고 문헌 46인용 수 5
한 줄 요약

이 논문은 단어 수준의 애너테이션을 사용하여 텍스트 인식을 이미지 분류 문제로 간주하는 분류 기반 시각적 텍스트 인식 접근법을 재검토한다. CSTR는 간단하지만 효과적인 모델로, 단어 수준의 애너테이션을 사용하여 텍스트 인식을 이미지 분류 문제로 간주한다. CSTR는 새로운 백본(CPNet)과 예측 헤드(SPPN)를 사용하여 여섯 가지 벤치마크에서 거의 최신 기술 수준의 성능을 달성하며, seq2seq 및 세그멘테이션 기반 방법을 모두 앞서면서도 ResNet 수준의 단순성 유지를 유지한다.

ABSTRACT

The prevalent perspectives of scene text recognition are from sequence to sequence (seq2seq) and segmentation. Nevertheless, the former is composed of many components which makes implementation and deployment complicated, while the latter requires character level annotations that is expensive. In this paper, we revisit classification perspective that models scene text recognition as an image classification problem. Classification perspective has a simple pipeline and only needs word level annotations. We revive classification perspective by devising a scene text recognition model named as CSTR, which performs as well as methods from other perspectives. The CSTR model consists of CPNet (classification perspective network) and SPPN (separated conv with global average pooling prediction network). CSTR is as simple as image classification model like ResNet \cite{he2016deep} which makes it easy to implement and deploy. We demonstrate the effectiveness of the classification perspective on scene text recognition with extensive experiments. Futhermore, CSTR achieves nearly state-of-the-art performance on six public benchmarks including regular text, irregular text. The code will be available at https://github.com/Media-Smart/vedastr.

연구 동기 및 목표

  • 이전 연구에서 성능이 열악하여 간과당한 분류 기반 접근법을 시각적 텍스트 인식 분야에서 재활성화하기 위해.
  • 복잡한 seq2seq 및 세그멘테이션 기반 방법의 성능를 유지하면서도 단어 수준의 애너테이션만을 사용하는 모델을 설계하기 위해.
  • 문자 수준의 애너테이션과 복잡한 디코더 아키텍처가 필요 없도록 시각적 텍스트 인식 파이프라인을 단순화하기 위해.
  • 적절한 예측 네트워크 및 백본 설계가 분류 기반 방법이 최신 기술 수준의 접근법과 경쟁 가능하게 만들 수 있음을 보여주기 위해.
  • 데이터 증강과 공간 변환 기법이 분류 기반 STR 모델 성능 향상에 미치는 중요성을 부각하기 위해.

제안 방법

  • 고정 길이 출력 헤드를 각 문자 위치에 대해 갖는 다중 헤드 이미지 분류 문제로 간주하는 완전 컨볼루션 모델인 CSTR를 제안한다.
  • 확장된 수신 필드와 의미 인식 다운샘플링 모듈(SADM)을 갖춘 재설계된 백본 네트워크인 CPNet을 도입하여 특징 표현을 향상시킨다.
  • 전역 평균 풀링과 각 문자 위치별 독립적인 컨볼루션을 사용하여 위치적 맥락을 인코딩하는 SPPN(Separated Conv with Global Average Pooling Prediction Network)을 설계한다.
  • CTC 손실 대신 교차 엔트로피 손실을 사용하여, 적절한 예측 네트워크 설계가 CE가 CTC를 능가할 수 있음을 보여준다.
  • 더욱 견고하고 정확한 성능 향상을 위해 데이터 증강과 공간 변환 네트워크(STN)를 적용한다.
  • 고정된 최대 시퀀스 길이와 종료 토큰을 사용하여 가변 길이 단어를 처리하고, 표준 분류 목표 함수를 사용한 엔드 투 엔드 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1분류 기반 접근법이 시각적 텍스트 인식에서 seq2seq 및 세그멘테이션 기반 방법과 유사한 성능을 달성할 수 있는가?
  • RQ2잘 설계된 예측 헤드와 백본 네트워크가 분류 기반 접근법에서 교차 엔트로피 손실이 CTC 손실을 능가할 수 있는가?
  • RQ3데이터 증강 기법이 분류 기반 시각적 텍스트 인식 모델의 성능에 어떤 영향을 미치는가?
  • RQ4공간 변환 네트워크(STN)가 단순한 분류 기반 모델의 정확도를 추가로 향상시킬 수 있는가?
  • RQ5백본 내에서 강화된 수신 필드와 SADM 같은 아키텍처 구성 요소가 전체 성능에 기여하는 정도는 어떠한가?

주요 결과

  • CSTR는 ICDAR03, ICDAR13, ICDAR15, IIIT5k, SVT, SVTP를 포함한 여섯 가지 공개 벤치마크에서 거의 최신 기술 수준의 성능을 달성한다.
  • 데이터 증강을 적용한 결과, CSTR는 벤치마크 세트 평균 정확도 89.0%를 기록했으며, 공간 변환 네트워크를 추가로 결합하면 정확도가 89.4%로 향상된다.
  • SPPN을 통해 교차 엔트로피 손실이 CTC 손실을 능가하며, 동일한 백본에서 84.1%의 정확도를 기록한 반면 CTC는 83.8%를 기록한다.
  • 제거 실험 결과, 강화된 모듈(EM)이 정확도를 3.1%p 향상시켜 84.1%에서 87.2%로 개선하였으며, SADM은 추가로 0.1%p의 성능 향상을 기록하였다.
  • 데이터 증강은 성능 저하를 1.7%p 감소시켜, 분류 기반 STR 모델 훈련에서의 핵심적 역할을 입증하였다.
  • 모델의 단순성(ResNet 수준) 덕분에 구현, 학습, 배포가 용이하며, 복잡한 seq2seq 파이프라인과는 달리 간편하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.