Skip to main content
QUICK REVIEW

[논문 리뷰] Symmetry-constrained Rectification Network for Scene Text Recognition

Mingkun Yang, Yushuo Guan|arXiv (Cornell University)|2019. 08. 06.
Handwritten Text Recognition Techniques인용 수 19
한 줄 요약

이 논문은 중심선, 방향성, 척도를 이용하여 텍스트 정규화에서 기하학적 대칭성을 강제함으로써 시나리오 텍스트 인식 성능을 향상시키는 대칭 제약 정규화 네트워크(Symmetry-constrained Rectification Network, ScRN)를 제안한다. 명시적인 대칭 제약 조건을 통해 텍스트 형태를 모델링함으로써 ScRN은 비정규 텍스트에서 특히 우수한 성능을 기록하며, ICDAR 2015에서는 ASTER 대비 2.6%의 정확도 향상을, CUTE80에서는 8%의 향상을 기록한다.

ABSTRACT

Reading text in the wild is a very challenging task due to the diversity of text instances and the complexity of natural scenes. Recently, the community has paid increasing attention to the problem of recognizing text instances with irregular shapes. One intuitive and effective way to handle this problem is to rectify irregular text to a canonical form before recognition. However, these methods might struggle when dealing with highly curved or distorted text instances. To tackle this issue, we propose in this paper a Symmetry-constrained Rectification Network (ScRN) based on local attributes of text instances, such as center line, scale and orientation. Such constraints with an accurate description of text shape enable ScRN to generate better rectification results than existing methods and thus lead to higher recognition accuracy. Our method achieves state-of-the-art performance on text with both regular and irregular shapes. Specifically, the system outperforms existing algorithms by a large margin on datasets that contain quite a proportion of irregular text instances, e.g., ICDAR 2015, SVT-Perspective and CUTE80.

연구 동기 및 목표

  • 자연 환경에서 곡률, 왜곡, 복잡한 배경으로 인해 여전히 어려움을 겪는 비정형 텍스트 인식 문제를 해결하기 위해.
  • 중심선, 방향성, 척도와 같은 기하학적 사전 지식을 통합하여 비정형 텍스트의 정규화 품질을 향상시키기 위해.
  • 기존 텍스트 인식기와의 통합에 적합한 경량이며 미분 가능한 정규화 모듈을 설계하여 계산 오버헤드 없이 정확도를 향상시키기 위해.
  • 특히 비정형 텍스트 인스턴스 비율이 높은 데이터셋을 포함한 표준 벤치마크에서 최고 성능을 달성하기 위해.

제안 방법

  • 텍스트 중심선의 국소 기하 속성을 기반으로 제어점을 예측하는 세그멘테이션 기반 네트워크를 사용한다.
  • 문자들의 방향성과 척도 정보를 활용하여 제어점을 중심선을 기준으로 공간적으로 대칭되도록 제약 조건을 적용함으로써 대칭성을 강제한다.
  • 오직 두 개의 컨볼루션 레이어로 구성되어 있어 기존 텍스트 인식기와의 통합에 매우 경량이고 효율적이다.
  • 정규화 과정이 미분 가능하며, 인식 모델과 함께 엔드 투 엔드로 훈련 가능하여 정렬 및 특징 학습을 향상시킨다.
  • 단어 수준의 지도 학습을 활용하며, 훈련 과정에서 자동으로 생성된 문자 수준의 애너테이션을 유용하게 활용한다.
  • 연속적인 중심선 표현을 통해 직선형에서부터 극도로 굽은 텍스트까지도 탄력적으로 모델링할 수 있다.

실험 결과

연구 질문

  • RQ1명시적인 대칭 제약 조건이 극도로 굽은 또는 왜곡된 환경에서 텍스트 정규화의 견고성과 정확도를 향상시킬 수 있는가?
  • RQ2중심선의 방향성과 문자의 척도와 같은 기하학적 속성을 통합할 경우 정규화 품질에 어떤 영향을 미치는가?
  • RQ3경량이며 미분 가능한 정규화 모듈이 계산 비용을 증가시키지 않으면서도 최고 성능을 달성할 수 있는가?
  • RQ4기존의 STN 기반 정규화 네트워크에 비해 제안된 방법이 비정형 텍스트 벤치마크에서 얼마나 뛰어난 성능을 보이는가?

주요 결과

  • ScRN은 7개의 표준 시나리오 텍스트 인식 벤치마크에서 최고 성능을 기록하였으며, 비교된 모든 방법 중 12개 결과 중 6개가 최고 성능이었다.
  • ICDAR 2015 데이터셋에서 ScRN은 ASTER 대비 2.6%의 정확도 향상을 기록하여 비정형 텍스트에서 강력한 견고성을 입증하였다.
  • CUTE80 데이터셋에서 ScRN은 ASTER 대비 8%의 성능 향상을 기록하여 극도로 굽은 및 왜곡된 텍스트에서의 효과성을 입증하였다.
  • 어휘 제약 조건 없이도 IIIT5K, IC03, IC13에서 각각 1%, 0.5%, 2.1%의 정확도 향상을 기록하였다.
  • SVTP에서 ScRN은 ASTER 대비 2.3% 높은 성능을 기록하여 도전적인 비정형 텍스트에서의 우수성을 다시 한번 확인하였다.
  • SVT에서 약간의 성능 저하(ASTER 대비 0.6% 낮음)가 있었지만, 모델은 여전히 경쟁력이 있었으며, 실패 사례는 좌측 문자의 가림과 단방향 디코딩의 영향으로 기인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.