Skip to main content
QUICK REVIEW

[논문 리뷰] TextMountain: Accurate Scene Text Detection via Instance Segmentation

Yixing Zhu, Jun Du|arXiv (Cornell University)|2018. 11. 30.
Handwritten Text Recognition Techniques참고 문헌 33인용 수 18
한 줄 요약

TextMountain는 텍스트 중심-경계 확률(TCBP)과 텍스트 중심-방향(TCD) 예측을 통한 인스턴스 세그멘테이션을 이용한 새로운 시나리오 텍스트 검출 방법을 제안한다. 이는 정확한 분리 및 텍스트 인스턴스 그룹화를 가능하게 하며, MLT에서 76.85%의 최고 성능 F-측정치와 SCUT-CTW1500에서 83.2%를 기록한다. 또한 고속 추론을 위한 GPU 가속 후처리를 통해 빠른 성능을 달성한다.

ABSTRACT

In this paper, we propose a novel scene text detection method named TextMountain. The key idea of TextMountain is making full use of border-center information. Different from previous works that treat center-border as a binary classification problem, we predict text center-border probability (TCBP) and text center-direction (TCD). The TCBP is just like a mountain whose top is text center and foot is text border. The mountaintop can separate text instances which cannot be easily achieved using semantic segmentation map and its rising direction can plan a road to top for each pixel on mountain foot at the group stage. The TCD helps TCBP learning better. Our label rules will not lead to the ambiguous problem with the transformation of angle, so the proposed method is robust to multi-oriented text and can also handle well with curved text. In inference stage, each pixel at the mountain foot needs to search the path to the mountaintop and this process can be efficiently completed in parallel, yielding the efficiency of our method compared with others. The experiments on MLT, ICDAR2015, RCTW-17 and SCUT-CTW1500 databases demonstrate that the proposed method achieves better or comparable performance in terms of both accuracy and efficiency. It is worth mentioning our method achieves an F-measure of 76.85% on MLT which outperforms the previous methods by a large margin. Code will be made available.

연구 동기 및 목표

  • 높은 정확도로 자연 풍경 내에서 긴, 다중 방향성, 곡선형 텍스트 라인을 검출하는 데 도전한다.
  • 기존의 의미 세그멘테이션 또는 이진 중심-경계 분류 방식으로 인한 텍스트 인스턴스 분리의 모호함을 해결한다.
  • TCBP의 산맥 구조를 통해 픽셀 수준에서 병렬 그룹화를 가능하게 하여 추론 시 후처리 시간을 단축시킨다.
  • 고정된 다각형 정점 순서에 의존하지 않고 다양한 텍스트 형태와 방향성에 대해 강력한 성능을 유지도한다.
  • 고해상도 이미지와 실시간 응용에 적합한 효율적이고 확장 가능한 추론을 가능하게 한다.

제안 방법

  • 텍스트 중심에서 1로, 텍스트 경계에서 0으로 감쇠하는 텍스트 중심-경계 확률(TCBP) 맵을 예측하여 '산' 구조를 형성한다.
  • TCBP 학습을 안내하고 특징 표현을 향상시키기 위해 텍스트 중심-방향(TCD)을 도입하지만, 추론 시에는 사용하지 않는다.
  • TCBP의 상승 방향을 이용해 경계 픽셀에서 산정점으로의 경로를 계획함으로써 인스턴스 수준의 분리를 가능하게 한다.
  • 모든 픽셀을 동시에 처리하는 GPU 가속 병렬 그룹화 알고리즘을 구현하여 후처리 시간을 크게 단축시켰다.
  • 완전 컨volution 네트워크(FCN)를 학습하여 텍스트 스코어(TS), TCBP, TCD 맵을 엔드 투 엔드로 동시에 예측한다.
  • 회전 및 곡선에 관계없이 불변인 레이블 규칙을 적용하여 다중 방향성 및 곡선 텍스트에 대한 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1산맥 구조를 가진 학습된 TCBP 맵이 고정된 바운딩 박스에 의존하지 않고 인접한 텍스트 인스턴스를 효과적으로 분리할 수 있는가?
  • RQ2TCD를 예측함으로써 TCBP 학습 품질이 향상되고 곡선형 및 다중 방향성 텍스트에 대한 일반화 성능이 향상되는가?
  • RQ3TCBP 맵에서 경계에서 중심으로 향하는 병렬 경로 탐색이 순차적 그룹화에 비해 후처리 속도를 크게 향상시킬 수 있는가?
  • RQ4기존 최고 성능(SOTA) 방법과 비교해 장시간, 다중 방향성, 곡선형 텍스트 라인을 포함한 데이터셋에서 이 방법의 성능은 어떠한가?
  • RQ5이 방법은 레이블의 모호함을 유발하지 않고도 이미지 변환(예: 회전, 스케일링)에 대해 강건한가?

주요 결과

  • TextMountain는 MLT 데이터셋에서 76.85%의 F-측정치를 기록하여 이전 방법들을 크게 능가한다.
  • SCUT-CTW1500에서 정밀도 82.9%, 재현도 83.4%, F-측정치 83.2%를 기록하여 곡선 텍스트 검출에서 뛰어난 성능을 보였다.
  • ICDAR2015에서 10.5 FPS로 실행되며, GPU 기반 그룹화가 CPU 기반 cython 구현보다 200배 이상 빠르다.
  • 고해상도 RCTW-17 이미지(긴 변 길이 1500)에서 GPU 기반 그룹화 소요 시간은 0.0013초/이미지이며, CPU 기반 그룹화와 비교해 1.2910초로 훨씬 빠르다.
  • 전체 라인을 감싸는 수신장이 필요 없이도 TCBP 기반의 그룹화 메커니즋试로 장시간 텍스트 라인에서도 높은 정확도를 유지한다.
  • TCD 구성 요소는 TCBP 학습을 향상시키며, 모든 벤치마크 데이터셋에서 일관된 성능 향상을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.