Skip to main content
QUICK REVIEW

[논문 리뷰] MOST: A Multi-Oriented Scene Text Detector with Localization Refinement

Minghang He, Minghui Liao|arXiv (Cornell University)|2021. 04. 02.
Handwritten Text Recognition Techniques참고 문헌 43인용 수 4
한 줄 요약

이 논문은 세 가지 핵심 기여를 통해 장거리 및 다중 스케일 텍스트 인스턴스의 국소화 정확도를 향상시키는 다중 방향 시나리오 텍스트 검출기 MOST를 제안한다: 동적 수신 영역 적응을 위한 텍스트 특징 정렬 모듈(TFAM), 검출 품질을 향상시키기 위한 위치 인식 비최대 억제(PA-NMS), 인스턴스별 IoU 손실을 통한 균형 잡힌 훈련. 이 방법은 MLT17, MTWI, MSRA-TD500 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 51.8 FPS의 빠른 추론 속도를 기록한다.

ABSTRACT

Over the past few years, the field of scene text detection has progressed rapidly that modern text detectors are able to hunt text in various challenging scenarios. However, they might still fall short when handling text instances of extreme aspect ratios and varying scales. To tackle such difficulties, we propose in this paper a new algorithm for scene text detection, which puts forward a set of strategies to significantly improve the quality of text localization. Specifically, a Text Feature Alignment Module (TFAM) is proposed to dynamically adjust the receptive fields of features based on initial raw detections; a Position-Aware Non-Maximum Suppression (PA-NMS) module is devised to selectively concentrate on reliable raw detections and exclude unreliable ones; besides, we propose an Instance-wise IoU loss for balanced training to deal with text instances of different scales. An extensive ablation study demonstrates the effectiveness and superiority of the proposed strategies. The resulting text detection system, which integrates the proposed strategies with a leading scene text detector EAST, achieves state-of-the-art or competitive performance on various standard benchmarks for text detection while keeping a fast running speed.

연구 동기 및 목표

  • 기존 검출기가 극단적인 종횡비를 가진 장거리 텍스트 인스턴스에서 낮은 국소화 정확도를 보이는 문제를 해결하기 위해.
  • 크기 변화가 큰 텍스트 인스턴스에 대한 검출 성능을 향상시키기 위해.
  • 다양한 데이터셋, 특히 다국어 및 웹 기반 이미지에서의 단일단계 텍스트 검출기의 강건성과 일반화 능력을 향상시키기 위해.
  • 가벼운 모듈식 구성 요소를 통해 검출 품질을 향상시키면서도 높은 추론 속도를 유지하기 위해.

제안 방법

  • 텍스트 특징 정렬 모듈(TFAM)은 굵은 검출 예측 기반으로 특징 맵의 수신 영역을 동적으로 조정하여, 장거리 텍스트에 대한 더 나은 맥락 모델링을 가능하게 한다.
  • 위치 인식 비최대 억제(PA-NMS)는 공간적 위치에 기반해 신뢰도가 높은 예측에 초점을 맞춰 원시 검출 결과를 선택적으로 융합함으로써 기하학적 편향을 감소시킨다.
  • 인스턴스별 IoU 손실은 손실 함수 내 각 텍스트 인스턴스의 기여도를 균형 있게 조정하여 다양한 스케일 간 공정한 최적화를 보장한다.
  • 이 방법은 ResNet-50-FPN 백본을 사용하는 EAST 검출기와 통합되며, 분류 헤드, 국소화 분지, 위치 민감도 맵 예측 헤드를 포함한다.
  • 국소화 분지는 굵은 국소화 헤드, TFAM, 정밀 국소화 헤드로 구성되어 경계 상자 회귀 성능을 향상시킨다.
  • 전반적인 파이프라인은 단순하고 효율적이며, 높은 정확도를 유지하면서도 빠른 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1동적 수신 영역 적응이 극단적인 종횡비를 가진 장거리 텍스트 인스턴스의 국소화 정확도 향상에 기여할 수 있는가?
  • RQ2위치 인식 억제가 신뢰도 높은 검출 결과에 우선순위를 두어 NMS의 기하학적 편향을 줄일 수 있는가?
  • RQ3인스턴스별 IoU 손실이 다양한 스케일의 텍스트 인스턴스 간 일반화 능력을 향상시키는가?
  • RQ4제안된 구성 요소들이 추론 속도를 희생시키지 않고 다국어 및 장거리 텍스트 데이터셋에서의 검출 성능을 향상시킬 수 있는가?

주요 결과

  • MSRA-TD500 테스트 세트에서 MOST는 정밀도 90.4%, 재현율 82.7%, F-측정치 86.4%를 기록하며, 이는 이전 SOTA 방법보다 F-측정치에서 1.5% 향상된 성능이다.
  • MLT17 벤치마크에서 MOST는 F-측정치 76.7%를 기록하며, 이는 이중단계 모델을 포함한 모든 비교 모델을 앞서며 재현율이 1.9% 높다.
  • MTWI 데이터셋에서 MOST는 F-측정치 74.7%를 기록하며, 모든 기준 모델보다 최소 1.2% 이상 높게 성능을 내어 다국어 및 웹 기반 텍스트에 대한 강력한 일반화 능력을 입증한다.
  • MLT17 검증 세트에서 MOST는 높은 정확도를 유지하면서도 빠른 추론 속도 51.8 FPS를 기록한다.
  • 제거 실험 결과 각 구성 요소—TFAM, PA-NMS, 인스턴스별 IoU 손실—이 성능 향상에 기여하며, 서로 다른 IoU 임계값 하에서 각각 4.0% 및 9.5% 향상된 성능을 보였다.
  • 제안된 전략은 일반화 가능하며 다른 단일단계 텍스트 검출 프레임워크로 쉽게 확장할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.