Skip to main content
QUICK REVIEW

[논문 리뷰] A Multi-Object Rectified Attention Network for Scene Text Recognition

Canjie Luo, Lianwen Jin|arXiv (Cornell University)|2019. 01. 10.
Handwritten Text Recognition Techniques참고 문헌 55인용 수 12
한 줄 요약

이 논문은 시나리오 텍스트 인식을 위한 다중 객체 교정 주의망(MORAN)을 제안한다. 이는 불규칙하고 왜곡된 텍스트를 독해하기 쉬운 수평 정렬 형태로 변환하는 다중 객체 교정망(MORN)과, 정확한 텍스트 예측을 위한 주의 기반 시퀀스 인식망(ASRN)을 조합한다. 이미지-텍스트 쌍만을 사용하는 약한 지도 학습 방식으로 훈련되며, SVT-Perspective 및 CUTE80와 같은 도전적인 불규칙 텍스트 데이터셋을 포함한 여러 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하여 시점, 곡률, 척도 변화에 대한 강건성을 입증한다.

ABSTRACT

Irregular text is widely used. However, it is considerably difficult to recognize because of its various shapes and distorted patterns. In this paper, we thus propose a multi-object rectified attention network (MORAN) for general scene text recognition. The MORAN consists of a multi-object rectification network and an attention-based sequence recognition network. The multi-object rectification network is designed for rectifying images that contain irregular text. It decreases the difficulty of recognition and enables the attention-based sequence recognition network to more easily read irregular text. It is trained in a weak supervision way, thus requiring only images and corresponding text labels. The attention-based sequence recognition network focuses on target characters and sequentially outputs the predictions. Moreover, to improve the sensitivity of the attention-based sequence recognition network, a fractional pickup method is proposed for an attention-based decoder in the training phase. With the rectification mechanism, the MORAN can read both regular and irregular scene text. Extensive experiments on various benchmarks are conducted, which show that the MORAN achieves state-of-the-art performance. The source code is available.

연구 동기 및 목표

  • 복잡한 왜곡, 예를 들어 시점, 곡률, 회전 등이 있는 불규칙한 시나리오 텍스트를 인식하는 데 도전 과제를 해결하기 위해.
  • 기하학적 지도 없이도 불규칙한 텍스트를 독해하기 쉬운 교정된 형태로 변환함으로써 인식 난이도를 낮추기 위해.
  • 분수형 피킹 방법을 통해 맥락 민감도를 향상시켜 주의 기반 시퀀스 인식을 향상시키기 위해.
  • 과정 학습을 통해 정교한 교정 및 인식 프레임워크의 엔드 투 엔드 훈련을 가능하게 하기 위해.
  • 기하학적 정보 없이도 다양한 텍스트 왜곡에 일반화할 수 있는 유연한, 기하학적 의존성이 없는 교정 메커니즘을 개발하기 위해.

제안 방법

  • MORAN 프레임워크는 좌표 격자에서 오프셋 격자를 예측함으로써 불규칙한 텍스트를 더 수평적이고 단단한 경계로 공간 변환할 수 있는 다중 객체 교정망(MORN)으로 구성된다.
  • MORN은 기하학적 또는 픽셀 수준의 지도 없이도 이미지와 텍스트 레이블만을 사용하는 약한 지도 학습 방식으로 훈련된다.
  • 주의 기반 시퀀스 인식망(ASRN)은 교정된 이미지를 처리하고 관련 특징 영역에 주의를 기울여 문자 시퀀스를 생성한다.
  • 훈련 중에 분수형 피킹 방법이 도입되어 다중 스케일에서 특징 맵을 무작위로 확장함으로써 수신 영역을 확장하고 맥락적 변동성에 대한 강건성을 향상시킨다.
  • 과정 학습 전략이 적용되며, 먼저 한 하위망(MORN 또는 ASRN)을 고정하고 다른 하위망을 최적화한 후 전체 네트워크를 공동으로 미세조정한다.
  • 교정 과정을 통해 기울기 역전파가 가능하도록 유사 공간 변환기 메커니즘을 사용하여 엔드 투 엔드 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1기하학적 지도 없이도 약한 지도 학습 방식으로 복잡한 텍스트 왜곡, 예를 들어 시점과 곡률을 효과적으로 처리할 수 있는가?
  • RQ2분수형 피킹 방법은 주의 기반 디코더의 민감도와 강건성을 어떻게 향상시키는가?
  • RQ3교정 및 인식의 공동 훈련이 고립된 모델 대비 불규칙한 시나리오 텍스트에서 성능 향상에 얼마나 기여하는가?
  • RQ4제안된 프레임워크는 저해상도 및 곡선 텍스트를 포함한 도전적인 텍스트 변형이 있는 벤치마크에서 어떻게 성능을 내는가?
  • RQ5제안된 방법은 임의의 형태와 복잡한 배경을 가진 실생활 시나리오 텍스트에 일반화될 수 있는가?

주요 결과

  • MORAN은 IIIT5K, SVT, ICDAR2003, ICDAR2013, ICDAR2015, SVT-Perspective, CUTE80를 포함한 여러 벤치마크에서 최신 기술 수준 성능을 달성한다.
  • SVT-Perspective 데이터셋에서 MORAN은 사전 없이도 모든 베이스라인을 능가하며, 50단어 사전을 사용할 경우 단어 정확도 87.6%를 달성하고, 사전 없이도 85.2%의 정확도를 기록한다.
  • qualitative 결과에서 CUTE80에서 작은 곡률 각도를 가진 곡선 텍스트도 성공적으로 교정하였으며, 대부분의 곡선 인스턴스가 정확하게 인식되었다.
  • 분수형 피킹 방법은 주의 디코더의 강건성을 크게 향상시켜 순차 예측 중 더 나은 정렬 및 맥락 모델링을 가능하게 하였다.
  • 과정 학습 전략은 MORN과 ASRN을 순차적으로 최적화한 후 엔드 투 엔드 미세조정함으로써 훈련 안정성과 최종 성능을 향상시켰다.
  • 매우 큰 곡률 각도나 복잡한 배경을 다루는 데에는 한계가 있지만, 자르기 및 수평 방향의 불규칙 텍스트에 대해 강력한 일반화 성능을 보이며, 표준 벤치마크에서 실패 사례는 흔하지 않다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.