Skip to main content
QUICK REVIEW

[논문 리뷰] Double Supervised Network with Attention Mechanism for Scene Text Recognition

Yuting Gao, Zheng Huang|arXiv (Cornell University)|2018. 08. 02.
Handwritten Text Recognition Techniques참고 문헌 29인용 수 8
한 줄 요약

이 논문은 사전 어휘 없이도 자연 환경에서의 장면 텍스트 인식을 위한 이중 지도 학습 엔드 투 엔드 딥 러닝 프레임워크인 DSAN을 제안한다. 이는 텍스트 주의 모듈과 두 가지 지도 분지(하나는 맥락 수준 모델링을 위한 것이고, 다른 하나는 문자 수준의 의미 강화를 위한 것)를 통합한다. 다중 작업 학습을 통해 명시적이고 암묵적인 의미 정보를 동시에 최적화함으로써, IIIT5K, ICDAR2013, SVT 벤치마크에서 각각 88.6%, 92.3%, 84.1%의 최신 기준 정확도를 달성한다.

ABSTRACT

In this paper, we propose Double Supervised Network with Attention Mechanism (DSAN), a novel end-to-end trainable framework for scene text recognition. It incorporates one text attention module during feature extraction which enforces the model to focus on text regions and the whole framework is supervised by two branches. One supervision branch comes from context-level modelling and another comes from one extra supervision enhancement branch which aims at tackling inexplicit semantic information at character level. These two supervisions can benefit each other and yield better performance. The proposed approach can recognize text in arbitrary length and does not need any predefined lexicon. Our method outperforms the current state-of-the-art methods on three text recognition benchmarks: IIIT5K, ICDAR2013 and SVT reaching accuracy 88.6%, 92.3% and 84.1% respectively which suggests the effectiveness of the proposed method.

연구 동기 및 목표

  • 텍스트가 명시적인 의미 맥락을 갖지 못할 수 있는 자연적이고 제약이 없는 환경에서 장면 텍스트를 인식하는 데 도전하는 것.
  • 사전에 정의된 어휘에 의존하지 않고도 임의의 길이의 텍스트 시퀀스에 대해 인식 성능을 향상시키는 것.
  • 주목적 및 다중 지도 학습을 통해 저품질, 혼잡하거나 열악한 조건의 텍스트 이미지에 대한 모델의 강건성을 향상시키는 것.
  • 장면 텍스트에서 명시적인 맥락적 관계와 암묵적인 문자 수준의 의미를 동시에 모델링하는 것.

제안 방법

  • 1/8 해상도의 특징 맵을 생성하기 위해 스트라이드를 수정한 ResNet-34 기반의 백본을 사용하며, 이 후 텍스트 주의 모듈이 적용된다. 이 모듈은 시그모이드 활성화를 갖는 3x1 컨볼루션을 통해 공간 주의 마스크를 생성한다.
  • 주의 마스크는 특징 맵에 브로드캐스트 곱셈을 적용하여 주의 가중치가 부여된 특징을 생성하며, 이는 관련 없는 영역을 억제하고 텍스트 관련 특징을 강화한다.
  • 주의 강화 특징는 두 개의 병렬 분지에 입력된다: 순차적 의존성을 캡처하기 위해 이중 방향 LSTM을 사용하는 맥락 수준 모델링 분지.
  • 추가로, 문자 수준의 분류기를 적용하여 암묵적인 의미 정보를 문자 수준에서 모델링하는 지도 강화 분지가 존재하며, 이는 두 번째 지도 신호를 제공한다.
  • 두 분지는 다중 작업 손실 함수를 통해 공동으로 학습되며, 맥락 수준과 문자 수준 지도 간의 균형을 조절하는 하이퍼파rameter λ가 존재한다.
  • 추론 과정에서는 전사 출력이 맥락 수준 모델링 분지에서 유도되며, 문자 수준 분지는 학습 중에 강력한 표현을 학습하는 데 기여한다.

실험 결과

연구 질문

  • RQ1명시적인 맥락적 관계와 암묵적인 문자 수준의 의미를 동시에 모델링하는 이중 지도 메커니즘이 장면 텍스트 인식 성능을 향상시킬 수 있는가?
  • RQ2텍스트 영역을 강조하는 학습 가능한 주의 모듈을 통합하면 도전적인 저품질 장면 이미지에서의 인식 정확도가 향상되는가?
  • RQ3지도 강화 분지가 강력한 맥락적 신호가 없는 텍스트 시퀀스에서 성능 향상에 얼마나 기여하는가?
  • RQ4맥락 수준과 문자 수준 지도 학습을 공동으로 수행할 경우, 다양한 벤치마크에서 일반화 성능에 어떤 영향을 미치는가?

주요 결과

  • DSAN은 IIIT5K 벤치마크에서 88.6%의 최신 기준 정확도를 달성하여 이전 방법들보다 뚜렷한 격차를 확보한다.
  • ICDAR2013에서 모델은 92.3%의 정확도를 기록하며, 이는 이전 최신 기준보다 1.5%포인트 높은 성능이다.
  • SVT 데이터셋에서는 DSAN이 84.1%의 정확도를 달성했으며, 지도 강화 분지를 포함하지 않은 베이스라인 대비 8.4%포인트 향상되었다.
  • 절단 실험 결과, 지도 강화 분지는 IIIT5K에서 5.0%포인트, ICDAR2013에서 3.1%포인트, SVT에서 6.7%포인트의 정확도 향상을 이룬 것으로 확인되었다.
  • 텍스트 주의 모듈은 SVT에서 1.7%포인트의 정확도 향상을 기여하여 배경 혼잡을 억제하고 텍스트 특징을 강화하는 데 효과적임을 입증한다.
  • 모델은 다양한 장면 텍스트 조건(다양한 폰트, 흐림, 불균형 조명 등)에서도 잘 일반화되며, 정성적 예시를 통해 이를 확인할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.