Skip to main content
QUICK REVIEW

[논문 리뷰] A Holistic Representation Guided Attention Network for Scene Text Recognition

Yang Lu, Dang, Fan|arXiv (Cornell University)|2019. 04. 02.
Handwritten Text Recognition Techniques참고 문헌 33인용 수 5
한 줄 요약

이 논문은 2D CNN 특징과 주의 기반 시퀀스 디코더 사이에 중간 시퀀스 표현을 거치지 않고 직접 연결하는 통합적 이미지 표현을 활용한 주의 기반 네트워크를 제안한다. 2D 공간 주의를 유도하기 위해 통합적 이미지 표현을 사용함으로써, 모델은 불규칙적이고 규칙적인 시나리오 텍스트 벤치마크에서 최신 기술 성능을 달성하면서도 병렬 학습이 가능해졌으며, RNN 기반 대비 1.5배에서 9.4배 빠른 역전파 및 1.3배에서 7.9배 빠른 순전파를 구현하였다. 이는 오직 단어 수준의 애너테이션만으로 이루어졌다.

ABSTRACT

Reading irregular scene text of arbitrary shape in natural images is still a challenging problem, despite the progress made recently. Many existing approaches incorporate sophisticated network structures to handle various shapes, use extra annotations for stronger supervision, or employ hard-to-train recurrent neural networks for sequence modeling. In this work, we propose a simple yet strong approach for scene text recognition. With no need to convert input images to sequence representations, we directly connect two-dimensional CNN features to an attention-based sequence decoder which guided by holistic representation. The holistic representation can guide the attention-based decoder focus on more accurate area. As no recurrent module is adopted, our model can be trained in parallel. It achieves 1.5x to 9.4x acceleration to backward pass and 1.3x to 7.9x acceleration to forward pass, compared with the RNN counterparts. The proposed model is trained with only word-level annotations. With this simple design, our method achieves state-of-the-art or competitive recognition performance on the evaluated regular and irregular scene text benchmark datasets.

연구 동기 및 목표

  • 복잡한 공간 레이아웃으로 인해 여전히 어려움을 겪고 있는 자연 이미지 내에서 비규칙한 형태의 텍스트를 인식하는 문제를 해결하기 위해.
  • 중간 시퀀스 표현과 RNN 기반 인코더가 필요 없도록 하여, 순차적이고 병렬 학습이 어려운 구조를 제거하기 위해.
  • 디코더를 위한 주의 지도로 통합적 이미지 표현을 도입함으로써 2D 특징 공간 내 주의 국소화 정확도를 향상시키기 위해.
  • 문자 수준 애너테이션의 비용을 피하기 위해 오직 단어 수준의 애너테이션만으로도 강력한 인식 성능을 달성하기 위해.
  • 반복 네트워크를 비반복적이고 병렬 처리 가능한 주의 기반 디코더로 대체함으로써 더 빠른 학습 및 추론을 가능하게 하기 위해.

제안 방법

  • 모델은 입력 이미지로부터 특징 맵과 통합적 표현을 추출하기 위해 2D CNN을 사용하며, 시퀀스 변환 과정을 생략한다.
  • 통합적 표현은 디코더의 은닉 상태와 연결되어 디코딩 중 특징 맵 상에서 2D 공간 주의를 유도한다.
  • 2D 교차 주의를 갖춘 주의 기반 디코더를 사용하여 각 문자 예측 시 관련된 공간 영역에 주의를 기울인다.
  • 디코더는 비반복적이며 완전히 미분 가능하므로 병렬 학습과 더 빠른 수렴이 가능하다.
  • 모델은 오직 단어 수준의 애너테이션만으로 엔드 투 엔드로 학습되며, 문자 수준 레이블이나 후처리가 필요로 하지 않는다.
  • 통합적 표현은 전역 평균 풀링을 통해 계산되고, 주의 가중치 조절을 위해 맥락 벡터로 변환된다.

실험 결과

연구 질문

  • RQ1통합적 이미지 표현이 비규칙한 시나리오 텍스트 인식에서 2D 특징 맵 내 주의 국소화 정확도를 향상시킬 수 있는가?
  • RQ2RNN을 비반복적이고 병렬 처리 가능한 디코더로 대체함으로써 정확도 손실 없이 학습 속도를 향상시킬 수 있는가?
  • RQ3오직 단어 수준의 애너테이션만을 사용하는 간단한 모델 아키텍처가 비규칙 텍스트 인식 벤치마크에서 최신 기술 성능을 달성할 수 있는가?
  • RQ4정규 및 비규칙 텍스트 데이터셋에서 제안된 방법은 RNN 기반 및 시퀀스 투 시퀀스 모델과 비교해 성능과 속도 면에서 어떻게 다른가?
  • RQ5모델의 주요 실패 유형은 무엇이며, 이는 이미지 품질과 텍스트 방향과 어떤 관련이 있는가?

주요 결과

  • IC15-1811에서 제안된 모델은 79.5%의 정확도를 달성하여 이전 최고의 단어 수준 방법(76.1%)보다 3.4% 향상되었다.
  • CT80에서 모델은 85.4%의 정확도를 기록하여 이전 최신 기술 단어 수준 방법(84.4%)보다 1.0% 향상되었다.
  • IIIT5K에서 모델은 94.7%의 정확도를 기록하여 최고의 단어 수준 기반 모델(94.3%)을 초월했으며, 문자 수준 모델과도 경쟁 가능했다.
  • 비반복적 설계 덕분에 RNN 기반 모델 대비 1.5배에서 9.4배 빠른 역전파 및 1.3배에서 7.9배 빠른 순전파를 기록하였다.
  • 실패 사례는 주로 흐린 이미지, 저해상도, 수직 텍스트, 조명 변화 및 가림으로 인해 발생하며, 특히 합성 데이터셋에서의 수직 텍스트 데이터 부족으로 인해 수직 텍스트가 특히 도전 과제로 나타났다.
  • 주의 메커니즘이 관련된 문자 영역에 성공적으로 집중했지만, 주의 맵에서 가끔 미세한 위치 이탈 현상이 관찰되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.