Skip to main content
QUICK REVIEW

[논문 리뷰] Gaussian Constrained Attention Network for Scene Text Recognition

Zhi Qiao, Xugong Qin|arXiv (Cornell University)|2020. 10. 19.
Handwritten Text Recognition Techniques참고 문헌 63인용 수 7
한 줄 요약

이 논문은 2차원 주의 기반 방법인 가우시안 제약 주의 네트워크(GCAN)를 제안한다. 이는 주의 분산을 줄이고 국소화 성능을 햖을 수 있도록 주의 가중치를 명시적으로 개선하기 위해 가우시안 제약 개선 모듈(GCRM)을 도입한다. GCAN은 최소한의 추론 오버헤드로 여러 장면 텍스트 인식 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Scene text recognition has been a hot topic in computer vision. Recent methods adopt the attention mechanism for sequence prediction which achieve convincing results. However, we argue that the existing attention mechanism faces the problem of attention diffusion, in which the model may not focus on a certain character area. In this paper, we propose Gaussian Constrained Attention Network to deal with this problem. It is a 2D attention-based method integrated with a novel Gaussian Constrained Refinement Module, which predicts an additional Gaussian mask to refine the attention weights. Different from adopting an additional supervision on the attention weights simply, our proposed method introduces an explicit refinement. In this way, the attention weights will be more concentrated and the attention-based recognition network achieves better performance. The proposed Gaussian Constrained Refinement Module is flexible and can be applied to existing attention-based methods directly. The experiments on several benchmark datasets demonstrate the effectiveness of our proposed method. Our code has been available at https://github.com/Pay20Y/GCAN.

연구 동기 및 목표

  • 장면 텍스트 인식에서 주의 가중치가 퍼지며 디코딩 과정에 노이즈를 유발하는 문제를 해결하기 위해.
  • 간접적 지도 학습에 의존하지 않고 학습 가능한 가우시안 마스크를 사용해 원시 주의 맵을 명시적으로 개선함으로써 주의 국소화 성능을 향상시키기 위해.
  • 기존의 2차원 주의 기반 인식 프레임워크에 쉽게 통합할 수 있는 유연한 모듈을 설계하기 위해.
  • 장문의 텍스트 시퀀스에서 주의 집중도와 정렬 성능을 향상시켜 더 나은 성능을 달성하기 위해.

제안 방법

  • 가우시안 제약 개선 모듈(GCRM)은 RNN의 은닉 상태와 구경 특징에서 가우시안 파라미터(평균 및 분산)를 예측하여 가우시안 마스크를 생성한다.
  • 원시 주의 맵은 예측된 가우시안 마스크와 요소별 곱셈을 통해 개선되어 더 집중된 주의 가중치를 얻는다.
  • 개선된 주의 가중치는 새로운 더 정확한 구경을 생성하고, 이는 원래의 구경과 융합되어 문자 예측에 사용된다.
  • GCRM은 플러그 앤 플레이 방식이며, SAR와 같은 기존의 2차원 주의 기반 모델에 아키텍처 변경 없이 통합될 수 있다.
  • 표준 교차 엔트로피 손실을 사용한 엔드 투 엔드 학습을 수행하며, 표준 인식 레이블 외에 추가 지도 학습이 필요하지 않다.
  • 제거 분석을 통해 GCRM과 최대우도 추정을 비교하여, 학습된 파라미터가 최대우도 추정보다 우수한 성능을 내는 것으로 나타났다.

실험 결과

연구 질문

  • RQ1학습 가능한 가우시안 마스크를 통해 주의 가중치를 명시적으로 개선하면 장면 텍스트 인식에서 주의 분산이 줄어들까?
  • RQ2제안된 GCRM은 추론 비용을 크게 증가시키지 않고도 인식 정확도를 향상시킬 수 있을까?
  • RQ3주어진 주의 가중치에 대한 추가 지도 학습과 비교했을 때, GCRM의 성능 향상과 내성은 어떻게 될까?
  • RQ4주의 메커니즘이 일반적으로 성능이 떨어지는 장문의 텍스트 시퀀스에서 이 방법은 성능을 유지하거나 향상시킬 수 있을까?

주요 결과

  • GCAN에 GCRM을 적용한 결과, IIIT5K에서 94.4%의 정확도를 달성했으며, 기준 SAR보다 1.4%p 향상되었고, 주의 지도 학습을 적용한 SAR보다는 1.3%p 향상되었다.
  • SVT에서 GCAN은 90.1%의 정확도를 기록했으며, 기준 SAR보다 3.4%p 향상되었고, 주의 지도 학습을 적용한 SAR보다는 2.8%p 향상되었다.
  • SVTP에서 GCAN은 81.2%의 정확도를 달성했으며, 기준 모델보다 2.1%p 향상되었고, 지도 학습을 적용한 SAR보다는 2.4%p 향상되었다.
  • 장문의 시퀀스에서 뛰어난 내성 확보: 레이블 길이가 길어질수록 오류율 증가 속도가 기준 모델 및 지도 학습을 적용한 SAR보다 더 느리게 증가한다.
  • 최대우도 추정 방식보다 GCRM이 성능이 뛰어나, 학습된 가우시안 마스크가 추정된 마스크보다 더 효과적임을 입증한다.
  • 속도 오버헤드가 극히 적다: GCAN은 평균적으로 학습 시 7.6ms, 추론 시 8.9ms의 추가 시간만 소요되어 실세계 적용에 매우 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.