Skip to main content
QUICK REVIEW

[논문 리뷰] Scene Text Detection via Holistic, Multi-Channel Prediction

Cong Yao, Xiang Bai|arXiv (Cornell University)|2016. 06. 29.
Handwritten Text Recognition Techniques참고 문헌 52인용 수 212
한 줄 요약

논문은 장면 텍스트 탐지를 의미 분할로 다루고 단일 FCN으로 텍스트 영역, 문자 및 연결 방향을 공동 예측하여 다방향 및 곡선 텍스트 탐지를 가능하게 하며 ICDAR 2013/2015, MSRA-TD500 및 COCO-Text에서 최첨단 결과를 달성한다.

ABSTRACT

Recently, scene text detection has become an active research topic in computer vision and document analysis, because of its great importance and significant challenge. However, vast majority of the existing methods detect text within local regions, typically through extracting character, word or line level candidates followed by candidate aggregation and false positive elimination, which potentially exclude the effect of wide-scope and long-range contextual cues in the scene. To take full advantage of the rich information available in the whole natural image, we propose to localize text in a holistic manner, by casting scene text detection as a semantic segmentation problem. The proposed algorithm directly runs on full images and produces global, pixel-wise prediction maps, in which detections are subsequently formed. To better make use of the properties of text, three types of information regarding text region, individual characters and their relationship are estimated, with a single Fully Convolutional Network (FCN) model. With such predictions of text properties, the proposed algorithm can simultaneously handle horizontal, multi-oriented and curved text in real-world natural images. The experiments on standard benchmarks, including ICDAR 2013, ICDAR 2015 and MSRA-TD500, demonstrate that the proposed algorithm substantially outperforms previous state-of-the-art approaches. Moreover, we report the first baseline result on the recently-released, large-scale dataset COCO-Text.

연구 동기 및 목표

  • 장면 텍스트 탐지를 전역 이미지 맥락을 활용할 수 있도록 의미론적 분할 문제로 해석한다.
  • 세 가지 텍스트 관련 특성: 텍스트 영역, 개별 문자, 문자 간 연결 방향을 함께 예측한다.
  • 분할을 이용한 픽셀 단위 맵에서 탐지를 형성하는 파이프라인을 개발한다(분할, 그래프 기반 그룹화 및 분할).
  • 다양한 방향 및 곡선 텍스트에 대한 강건성을 입증하고 표준 벤치마크(ICDAR 2013/2015, MSRA-TD500) 및 COCO-Text에서 검증한다.

제안 방법

  • HED에서 영감을 받은 Fully Convolutional Network (FCN)을 확장하여 이미지당 세 가지 예측 맵을 출력: 텍스트 영역, 문자(학습 중 축소 처리), 그리고 연결 방향.
  • GT 맵은 이진 영역 맵, 이진 문자 맵, 그리고 소프트 방향 맵으로 구성되며 방향은 [-π/2, π/2] 범위에서 정의되고 [0,1]로 정규화된다.
  • 텍스트 영역 손실, 문자 손실, 방향 손실을 가중 합산한 다채널 손실로 융합 및 학습하되 동등 가중치 (λ1=λ2=λ3=1/3).
  • 추론 중 예측 맵을 생성하고 적응 임계값을 적용하여 텍스트 영역 및 문자 후보를 얻은 후 델로네 삼각분할(Delaunay)과 그래프를 사용해 문자를 텍스트 라인으로 연결한다.
  • 그래프 기반 그룹화는 최대 신장 트리와 직선도/거리/방향 기반 점수를 사용해 문자를 텍스트 라인으로 분할하며 곡선 텍스트를 수용하기 위해 비선형 레이아웃을 처리하는 임계값 τ를 도입한다.
  • 테스트 시 스케일 간 융합을 통해 최종 탐지를 생성한다.

실험 결과

연구 질문

  • RQ1장면 텍스트 탐지를 전체 이미지에 걸친 픽셀 수준의 예측으로 전환하면 지역적 영역 기반 의사결정보다 개선될 수 있는가?
  • RQ2하나의 FCN에서 추가 텍스트 속성(문자와 연결 방향)을 예측하는 것이 인접한 텍스트 인스턴스의 분리 및 그룹화를 개선하는가?
  • RQ3그래프 기반 다채널 예측 프레임워크가 자연스러운 다방향 및 곡선 텍스트를 강건하게 탐지할 수 있는가?
  • RQ4전체적인 다채널 텍스트 탐지가 표준 벤치마크(ICDAR 2013/2015, MSRA-TD500) 및 COCO-Text에서 기존 기법과 비교해 어떤 성능을 보이는가?

주요 결과

  • 제안된 방법은 ICDAR 2013에서 높은 재현율(0.8022), 정밀도 0.8888 및 F-점수 0.8433을 달성한다.
  • ICDAR 2015에서 정밀도 0.7226, 재현율 0.5869, F-점수 0.6477으로 재현율에서 여러 기준을 능가하고 정밀도에서도 최상위에 근접하다.
  • MSRA-TD500에서 정밀도 0.7651, 재현율 0.7531, F-점수 0.7591로 재현율에서 이전 연구 대비 상당한 개선을 보인다.
  • COCO-Text 검증에서 정밀도 0.4323, 재현율 0.271, F-점수 0.3331로 크고 다양한 데이터셋에서도 확장성을 보인다.
  • 이 접근법은 다양한 언어, 스크립트, 곡선 텍스트 및 도전적인 실제 조건에 대해 정성적으로 강건함을 보인다.
  • 추론은 640x480 이미지당 약 0.42초(K40m GPU), 약 0.2초 CPU 후처리로 수행된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.