Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting Oriented Text in Natural Images by Linking Segments

Baoguang Shi, Xiang Bai|arXiv (Cornell University)|2017. 03. 19.
Handwritten Text Recognition Techniques참고 문헌 24인용 수 14
한 줄 요약

이 논문은 텍스트를 검출 가능한 세그먼트와 연결선으로 분해하고, 전체 컨volution 네트워크를 사용해 세그먼트(기울어진 경계 상자)와 연결선(연속된 세그먼트 간의 연결)을 동시에 예측하는 새로운 기울어진 텍스트 검출 방법인 SegLink를 제안한다. 이 방법은 ICDAR 2015에서 75.0%의 F-측정치를 기록하며 최신 기술 수준을 달성했으며, 20 FPS 이상으로 빠른 속도로 작동하며, 수정 없이도 중국어와 같은 비라틴 문자도 자연스럽게 처리할 수 있다.

ABSTRACT

Most state-of-the-art text detection methods are specific to horizontal Latin text and are not fast enough for real-time applications. We introduce Segment Linking (SegLink), an oriented text detection method. The main idea is to decompose text into two locally detectable elements, namely segments and links. A segment is an oriented box covering a part of a word or text line; A link connects two adjacent segments, indicating that they belong to the same word or text line. Both elements are detected densely at multiple scales by an end-to-end trained, fully-convolutional neural network. Final detections are produced by combining segments connected by links. Compared with previous methods, SegLink improves along the dimensions of accuracy, speed, and ease of training. It achieves an f-measure of 75.0% on the standard ICDAR 2015 Incidental (Challenge 4) benchmark, outperforming the previous best by a large margin. It runs at over 20 FPS on 512x512 images. Moreover, without modification, SegLink is able to detect long lines of non-Latin text, such as Chinese.

연구 동기 및 목표

  • 일般的한 객체 검출기의 긴 기울어진 텍스트와 극단적인 종횡비를 처리하는 데서 나타나는 한계를 해결하기 위해.
  • 실시간 기울어진 텍스트 검출을 위한 검출 속도 향상과 학습의 단순화를 위해.
  • 아키텍처 수정 없이도 중국어와 같은 비라틴 문자에 대한 강력한 검출 성능을 확보하기 위해.
  • 전역 경계 상자 제안에 의존하는 대신, 국소적으로 검출 가능한 구성요소인 세그먼트와 연결선을 사용해 텍스트 구조를 모델링하기 위해.

제안 방법

  • 이 방법은 텍스트를 세그먼트(단어의 일부를 커버하는 기울어진 상자)와 연결선(연속된 세그먼트 간의 연결을 나타내어 같은 단어에 属함을 의미)으로 분해한다.
  • VGG-16 백본을 사용한 전체 컨볼루션 신경망이 여섯 개의 특징 레이어에서 다중 스케일로 세그먼트와 연결선을 검출한다.
  • 두 가지 유형의 연결선을 사용한다: 동일 레이어 내 연결선(같은 레이어의 인접 세그먼트 간 연결)과 레이어 간 연결선(연속된 특징 레이어의 세그먼트 간 연결)으로 공간적 및 스케일 관련 세그먼트를 연결한다.
  • 검출된 연결선을 기반으로 깊이 우선 탐색(DFS) 알고리즘을 사용해 세그먼트를 전체 단어로 조합한다.
  • 세그먼트와 연결선을 동시에 예측하기 위해 다중 작업 손실을 사용해 엔드 투 엔드로 네트워크를 훈련시킨다.
  • 후처리 단계에서는 비최대 억제와 임계값 필터링(α 및 β)을 사용해 중복 검출를 제거한다.

실험 결과

연구 질문

  • RQ1전체 컨볼루션 및 엔드 투 엔드 딥 러닝 모델이 기존 방법보다 기울어진 텍스트를 더 정확하고 효율적으로 검출할 수 있는가?
  • RQ2세그먼트-연결 전략이 아키텍처 수정 없이도 중국어와 같은 비라틴 문자에 일반화 가능한가?
  • RQ3텍스트를 국소적으로 검출 가능한 세그먼트와 연결선의 시퀀스로 모델링하는 방식이 복잡한 배경과 변동하는 종횡비에 대해 강건성을 향상시키는가?
  • RQ4표준 기준에서 기울어진 텍스트 및 수평 텍스트에 대해 SegLink의 성능이 최신 기술 수준의 방법들과 비교해 어떻게 되는가?

주요 결과

  • SegLink는 ICDAR 2015 Incidental(챌린지 4) 기준에서 F-측정치 75.0%를 기록하여 이전 최고 성능 기준(64.8%)을 크게 뛰어넘었다.
  • 512×512 이미지에서 20 FPS 이상으로 작동하여 이전 방법들에 비해 높은 추론 효율성을 입증했다.
  • 아키텍처 수정 없이도 다국어 환경에서 긴 중국어 텍스트 라인을 성공적으로 검출했다.
  • TD500 데이터셋에서 SegLink는 비교된 방법들 중 가장 높은 정밀도(86%)와 F-측정치(77%)를 기록했으며, 추론 속도는 8.9 FPS였다.
  • IC13 수평 텍스트 기준에서 SegLink는 F-측정치 85.3%와 20.6 FPS를 기록했으며, F-측정치 기준으로 두 번째로 높았고, 대부분의 이전 방법들보다 훨씬 빠른 속도를 보였다.
  • 실패 케이스로는 큰 문자 간격과 곡선 텍스트가 있으며, 주로 현재 직사각형 상자만 생성 가능한 세그먼트 조합 알고리즘의 한계로 인한 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.