Skip to main content
QUICK REVIEW

[논문 리뷰] Scene Text Detection with Supervised Pyramid Context Network

Enze Xie, Yuhang Zang|arXiv (Cornell University)|2018. 11. 21.
Handwritten Text Recognition Techniques참고 문헌 26인용 수 22
한 줄 요약

이 논문은 문맥 세분화 지침과 재평가 기법을 통합하여 잡음 감소를 통해 정확도를 향상시키는 지도 학습 기반 피라미드 컨텍스트 네트워크(SPCNET)를 제안한다. FPN과 Mask R-CNN 아키텍처를 기반으로 하며, 전역적 컨텍스트와 정밀화된 분류 점수를 활용하여 다양한 벤치마크에서 최신 기술 수준의 성능을 달성한다. ICDAR2013에서는 92.1%의 F-측정값, Total-Text에서는 82.9%를 기록한다.

ABSTRACT

Scene text detection methods based on deep learning have achieved remarkable results over the past years. However, due to the high diversity and complexity of natural scenes, previous state-of-the-art text detection methods may still produce a considerable amount of false positives, when applied to images captured in real-world environments. To tackle this issue, mainly inspired by Mask R-CNN, we propose in this paper an effective model for scene text detection, which is based on Feature Pyramid Network (FPN) and instance segmentation. We propose a supervised pyramid context network (SPCNET) to precisely locate text regions while suppressing false positives. Benefited from the guidance of semantic information and sharing FPN, SPCNET obtains significantly enhanced performance while introducing marginal extra computation. Experiments on standard datasets demonstrate that our SPCNET clearly outperforms start-of-the-art methods. Specifically, it achieves an F-measure of 92.1% on ICDAR2013, 87.2% on ICDAR2015, 74.1% on ICDAR2017 MLT and 82.9% on Total-Text.

연구 동기 및 목표

  • 복잡한 시각 조건에서 지속적으로 발생하는 높은 잡음 비율 문제를 해결한다.
  • 기존 방법이 어려움을 겪는 다중 방향성, 다국어 및 곡선형 텍스트 인스턴스에 대해 탐지 성능을 향상시킨다.
  • 전역적 의미적 컨텍스트를 통합하고 재평가 기법을 통해 분류 점수를 보정하여 잡음 감소를 달성한다.
  • 탐지 및 세분화 브랜치 간 공유된 특징을 활용하여 추가 계산 비용을 최소화함으로써 높은 효율성을 유지한다.

제안 방법

  • FPN 기반 Mask R-CNN에 의미 세분화 브랜치를 추가하여 전역적 컨텍스트를 제공함으로써 더 나은 객체 식별을 위한 지도 학습 기반 피라미드 컨텍스트 네트워크(SPCNET)를 제안한다.
  • 탐지 브랜치에 의미 세분화 브랜치에서 유도된 전역적 의미적 신호를 융합하여 특징 표현을 향상시키는 텍스트 컨텍스트 모듈을 도입한다.
  • 분류 점수와 세분화 브랜치의 활성화 반응을 조합하여 융합 점수를 생성하는 재평가 기법을 설계하여 기울어진 또는 낮은 점수의 텍스트 인스턴스에 대한 신뢰도를 향상시킨다.
  • 세분화 마스크 출력을 활용하여 곡선형 및 다중 방향성 텍스트를 포함한 임의의 형태의 텍스트 탐지가 가능하도록 한다.
  • 공통 백본 특징을 활용하여 객체 탐지, 인스턴스 세분화, 분류의 다중 태스크 학습을 종합적으로 수행함으로써 계산 비용을 절감한다.
  • 일반화 성능 향상을 위해 MLT 데이터셋에서 사전 학습된 가중치를 사용하여 특정 데이터셋(예: ICDAR2013, Total-Text)에서의 미세 조정을 수행한다.

실험 결과

연구 질문

  • RQ1텍스트와 유사한 무늬를 가진 객체에 대해 전역적 의미적 컨텍스트가 잡음 감소에 상당한 기여를 할 수 있는가?
  • RQ2세분화 활성화 반응에 기반한 재평가 기법이 낮은 분류 점수를 가진 기울어진 또는 저명도가 낮은 텍스트에 대해 탐지 신뢰도를 향상시킬 수 있는가?
  • RQ3의미 지침이 있는 Mask R-CNN 기반 아키텍처가 곡선형 및 다중 방향성 텍스트를 포함한 임의의 형태의 텍스트를 얼마나 잘 탐지할 수 있는가?
  • RQ4의미 세분화와 재평가 기법의 통합이 다양한 벤치마크에서 다양한 텍스트 형태와 복잡도를 가진 환경에서 일관된 성능 향상을 이끌 수 있는가?
  • RQ5탐지 및 세분화 브랜치 간 특징 공유를 통해 추가 계산 비용을 최소화하면서도 높은 정확도를 유지할 수 있는가?

주요 결과

  • SPCNET는 단일 스케일 테스트 조건에서 ICDAR2013에서 92.1%의 F-측정값을 기록하여 이전 최신 기술 수준의 방법보다 1.5% 이상 높은 성능을 달성한다.
  • ICDAR2015에서는 87.2%의 F-측정값을 기록하여 기울어진 다중 방향성 텍스트 탐지에서 뛰어난 성능을 보인다.
  • 곡선형 및 다국어 텍스트를 포함하는 도전적인 Total-Text 데이터셋에서는 82.9%의 F-측정값을 기록하여 이전 방법들을 능가한다.
  • ICDAR2017 MLT 벤치마크에서는 74.1%의 F-측정값을 기록하여 다국어 및 다중 방향성 환경에서도 뛰어난 강건성을 보여준다.
  • 정성적 결과 분석에서 EAST, RRPN, TextBoxes++와 같은 기준 모델 대비 혼잡한 환경에서 뚜렷한 잡음 감소 효과를 확인할 수 있다.
  • 재평가 기법은 분류 점수가 낮은 경우에도 강력한 세분화 반응을 활용하여 기울어진 텍스트에 대한 신뢰도를 효과적으로 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.