Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Scene Text Detection with Connected Component Proposals

Fan Jiang, Zhihui Hao|arXiv (Cornell University)|2017. 08. 17.
Handwritten Text Recognition Techniques참고 문헌 18인용 수 7
한 줄 요약

이 논문은 영역별 세분화와 객체 검출을 통합하여 장면 텍스트 검출을 위한 이중 분기 딥 네트워크를 제안한다. 세분화 출력에 대해 연결된 성분 분석을 적용하여 단어 제안을 생성하고, 문자 검출 결과와 이러한 제안을 일치시키기 위해 일致성 손실을 도입함으로써, ICDAR 2013에서 F-스코어 0.919의 최고 성능을 달성하며, 재현율을 0.915로 크게 향상시켰다.

ABSTRACT

A growing demand for natural-scene text detection has been witnessed by the computer vision community since text information plays a significant role in scene understanding and image indexing. Deep neural networks are being used due to their strong capabilities of pixel-wise classification or word localization, similar to being used in common vision problems. In this paper, we present a novel two-task network with integrating bottom and top cues. The first task aims to predict a pixel-by-pixel labeling and based on which, word proposals are generated with a canonical connected component analysis. The second task aims to output a bundle of character candidates used later to verify the word proposals. The two sub-networks share base convolutional features and moreover, we present a new loss to strengthen the interaction between them. We evaluate the proposed network on public benchmark datasets and show it can detect arbitrary-orientation scene text with a finer output boundary. In ICDAR 2013 text localization task, we achieve the state-of-the-art performance with an F-score of 0.919 and a much better recall of 0.915.

연구 동기 및 목표

  • 하나의 하부 구조에서 밑에서 위로의 픽셀 수준 신호와 위에서 아래로의 객체 수준 검출을 통합하여 장면 텍스트 검출 성능을 향상시키기.
  • 일반적인 세분화 또는 검출 기반 방법이 임의의 텍스트 방향성과 복잡한 배경을 다루는 데에 한계를 보이는 문제를 해결하기.
  • 문자 후보와 연결된 성분 제안 간의 일치성 손실을 통해 잡음 감소 및 경계 정밀도 향상.
  • 다중 작업 장면 텍스트 검출에서 공유 특징 학습과 공동 학습의 효과를 입증하기.
  • 특히 임의의 방향성 텍스트에서 재현율과 F-스코어 측면에서 최고 성능을 달성하기 위해 공개 벤치마크에서 최고 성능을 내기.

제안 방법

  • 세분화 및 검출 분기 모두에서 conv1_1부터 conv4_3까지의 VGG-16 합성곱 계층을 공유 기반으로 사용한다.
  • 세분화 분기는 픽셀 단위 분류를 수행하고, 세분화 맵에 표준 연결된 성분 분석(CCA)을 적용하여 단어 제안을 생성한다.
  • 검출 분기는 Faster R-CNN 방식의 헤드를 사용하여 문자 후보를 예측하며, 이는 단어 제안을 확인한다.
  • 원시 CCA 출력과 검출된 문자 바운딩 박스 간의 일치를 강제하기 위해 새로운 일치성 손실을 도입한다.
  • 학습은 두 단계로 진행되며, 먼저 세분화 및 검출 헤드를 별도로 사전 학습하고, 이후 감소하는 학습률을 사용하여 공동 미세조정한다.
  • 참고 애너테이션은 다각형 형태의 텍스트 영역, 텍스트 영역 높이의 50% 지점에 해당하는 중심선, 95개 클래스(배경 포함)의 문자 바운딩 박스를 포함한다.

실험 결과

연구 질문

  • RQ1세분화와 검출의 공동 학습이 재현율과 경계 정밀도 측면에서 장면 텍스트 검출 성능 향상에 기여하는가?
  • RQ2세분화 출력에 연결된 성분 분석을 제안 기반으로 사용할 경우, 임의의 방향성 텍스트에 대해 전통적인 RPN 기반 또는 앵커 기반 방법보다 우월한가?
  • RQ3문자 검출 결과와 CCA로 생성된 제안 간의 일치성 강제 조건이 얼마나 효과적으로 잡음 신호를 감소시키고 국소화 정확도를 향상시키는가?
  • RQ4공유 특징과 새로운 일치성 손실을 갖춘 제안된 이중 분기 아키텍처는 단일 작업 또는 단순히 결합된 모델보다 어떻게 성능이 뛰어나며?
  • RQ5이 방법은 多국어 및 비라틴 문자 체계로도 일반화 가능하며, 이러한 도전적인 케이스에서도 높은 성능을 유지하는가?

주요 결과

  • 제안된 방법은 ICDAR 2013 Focused Text 데이터셋에서 최고 성능인 F-스코어 0.919를 달성하여, 모든 제출 중에서 1위를 기록했다.
  • 재현율이 0.915로 크게 향상되어, 특히 혼잡한 환경에서 진짜 텍스트 인스턴스를 잘 탐지하는 강력한 성능을 보였다.
  • 세분화 출력에 연결된 성분 분석을 적용함으로써, 임의의 방향성 및 복잡한 형태의 텍스트도 탐지할 수 있었으며, 이는 앵커 기반 방법보다 이 분야에서 뛰어난 성능을 보였다.
  • 문자 검출 결과와 CCA 제안 간의 일치성 손실은 잡음 신호 감소와 더불어 텍스트 경계 예측의 정밀도를 높였다.
  • 다국어 데이터셋에서도 강력한 성능 유지를 보였으며, 중국어와 같은 비라틴 문자 체계에서도 효과적임을 확인했다.
  • 제거 분석을 통해, 일치성 손실을 포함한 공동 학습이 기준 모델 대비 측정 가능한 성능 향상을 이끌어냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.