Skip to main content
QUICK REVIEW

[논문 리뷰] Look More Than Once: An Accurate Detector for Text of Arbitrary Shapes

Chengquan Zhang, Borong Liang|arXiv (Cornell University)|2019. 04. 13.
Handwritten Text Recognition Techniques참고 문헌 41인용 수 18
한 줄 요약

LOMO는 반복 보정과 유연한 형상 표현을 사용하여 임의의 형상과 매우 긴 텍스트의 검출을 향상시키는 새로운 시나리오 텍스트 검출기입니다. 직접 회귀자, 반복 보정 모듈, 형상 표현 모듈을 갖춘 종단 간 훈련 가능한 아키텍처를 통해 ICDAR2017-RCTW, SCUT-CTW1500, Total-Text, ICDAR2015, ICDAR17-MLT 등 다양한 벤치마크에서 최신 기술 수준의 성능을 달성합니다.

ABSTRACT

Previous scene text detection methods have progressed substantially over the past years. However, limited by the receptive field of CNNs and the simple representations like rectangle bounding box or quadrangle adopted to describe text, previous methods may fall short when dealing with more challenging text instances, such as extremely long text and arbitrarily shaped text. To address these two problems, we present a novel text detector namely LOMO, which localizes the text progressively for multiple times (or in other word, LOok More than Once). LOMO consists of a direct regressor (DR), an iterative refinement module (IRM) and a shape expression module (SEM). At first, text proposals in the form of quadrangle are generated by DR branch. Next, IRM progressively perceives the entire long text by iterative refinement based on the extracted feature blocks of preliminary proposals. Finally, a SEM is introduced to reconstruct more precise representation of irregular text by considering the geometry properties of text instance, including text region, text center line and border offsets. The state-of-the-art results on several public benchmarks including ICDAR2017-RCTW, SCUT-CTW1500, Total-Text, ICDAR2015 and ICDAR17-MLT confirm the striking robustness and effectiveness of LOMO.

연구 동기 및 목표

  • 기존 시나리오 텍스트 검출기가 매우 긴 텍스트와 임의의 형상 텍스트 인스턴스를 처리하는 데에 한계를 가진 문제를 해결하기 위해.
  • CNN의 제한된 수신 영역이 긴 텍스트 검출을 방해하는 문제를 해결하기 위해 다중 인지 사이클을 가능하게 함으로써.
  • 고정된 사각형 표현 방식을 대체하여 곡선, 파도 모양, 다중 방향 텍스트의 검출 정확도를 향상시키기 위해
  • 진행적인 예측 보정과 정확한 다각형 텍스트 인스턴스 재구성 기능을 갖춘 종단 간 훈련 가능한 검출기를 개발하기 위해.
  • 기울어진, 긴, 다국어, 비정형 형상의 텍스트를 포함한 다양한 텍스트 유형에서 강력한 성능을 달성하기 위해.

제안 방법

  • LOMO는 텍스트 인스턴스에 대한 초기 사각형 제안을 생성하기 위해 직접 회귀자(DR)를 사용합니다.
  • 반복 보정 모듈(IRM)은 여러 반복 동안 좌표 오프셋을 회귀하여 이러한 제안을 점진적으로 향상시켜 긴 텍스트의 국소화를 향상시킵니다.
  • IRM은 거리가 먼 영역에 집중할 수 있도록 위치 인식 주의 메커니즘을 사용하여 장거리 특징 인지 능력을 향상시킵니다.
  • 형상 표현 모듈(SEM)은 텍스트 영역, 중심선, 테두리 오프셋을 회귀하여 정확한 다각형 표현을 재구성합니다.
  • SEM은 수평, 다중 방향, 곡선, 파도 모양의 텍스트를 포함한 다양한 형상의 탄력적 모델링을 가능하게 합니다.
  • 전체 LOMO 프레임워크는 DR, IRM, SEM를 통합하여 공동 최적화를 위한 종단 간 훈련이 가능합니다.

실험 결과

연구 질문

  • RQ1반복 보정을 통해 다중 인지 사이클을 가능하게 하여 매우 긴 텍스트의 검출 정확도를 향상시킬 수 있는가?
  • RQ2유연한 형상 표현 모델이 곡선 및 비정형 형상 텍스트에 대해 표준 사각형 표현 방식을 능가할 수 있는가?
  • RQ3반복 보정과 형상 모델링을 결합하면 다양한 텍스트 유형에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4제안된 방법은 다양한 텍스트 형상, 방향, 길이를 가진 벤치마크 간에 일반화 가능한가?
  • RQ5LOMO의 성능은 긴 텍스트와 비정형 텍스트에 대해 종단 간 및 한 번의 검출 방법과 비교해 어떻게 되는가?

주요 결과

  • ICDAR2017-RCTW에서 LOMO는 78.4%의 H-mean을 기록하여 이전 방법들보다 긴 텍스트 및 비정형 텍스트 검출에서 뛰어난 성능을 보였다.
  • SCUT-CTW1500에서 LOMO는 단일 스케일 테스트 시 81.6% H-mean, 다중 스케일 테스트 시 83.3% H-mean을 기록하여 강력한 일반화 능력을 입증했다.
  • Total-Text에서 LOMO는 단일 스케일 시 75.7% H-mean, 다중 스케일 시 83.3% H-mean을 기록하여 곡선 및 다중 방향 텍스트에 대한 강건성을 보였다.
  • ICDAR2015에서 LOMO는 단일 스케일 테스트 시 87.2% H-mean, 다중 스케일 테스트 시 87.7% H-mean을 기록하여 비종단 간 방법을 초월하고 최상위 종단 간 모델과 동등한 성능을 달성했다.
  • ICDAR2017-MLT에서 LOMO는 다중 스케일 테스트 시 73.1% H-mean을 기록하여 기존 종단 간 방법들보다 최소 2.3% 이상 뛰어난 성능을 보였다.
  • 시각화 결과는 IRM이 긴 텍스트 검출을 크게 향상시키고, SEM이 복잡한 텍스트 형상에 정확하게 피팅하는 데 기여함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.