Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting Text in Natural Image with Connectionist Text Proposal Network

Zhi Tian, Weilin Huang|arXiv (Cornell University)|2016. 09. 12.
Handwritten Text Recognition Techniques참고 문헌 25인용 수 19
한 줄 요약

이 논문은 수직 앵커와 양방향 LSTM을 활용하여 컨volutional 특징 맵 내의 순차적이고 세밀한 제안을 연결함으로써 자연 이미지에서 텍스트 라인을 직접 검출하는 딥러닝 모델인 Connectionist Text Proposal Network (CTPN)을 제안한다. 이 방법은 ICDAR 2013에서 F-측도 0.88, ICDAR 2015에서 0.61의 최신 기준 성능을 달성하였으며, VGG16 백본을 사용할 경우 이미지당 추론 시간이 0.14초이다.

ABSTRACT

We propose a novel Connectionist Text Proposal Network (CTPN) that accurately localizes text lines in natural image. The CTPN detects a text line in a sequence of fine-scale text proposals directly in convolutional feature maps. We develop a vertical anchor mechanism that jointly predicts location and text/non-text score of each fixed-width proposal, considerably improving localization accuracy. The sequential proposals are naturally connected by a recurrent neural network, which is seamlessly incorporated into the convolutional network, resulting in an end-to-end trainable model. This allows the CTPN to explore rich context information of image, making it powerful to detect extremely ambiguous text. The CTPN works reliably on multi-scale and multi- language text without further post-processing, departing from previous bottom-up methods requiring multi-step post-processing. It achieves 0.88 and 0.61 F-measure on the ICDAR 2013 and 2015 benchmarks, surpass- ing recent results [8, 35] by a large margin. The CTPN is computationally efficient with 0:14s/image, by using the very deep VGG16 model [27]. Online demo is available at: http://textdet.com/.

연구 동기 및 목표

  • 다단계 후처리에 의존하고 잘못된 문자 검출에 민감한 바텀업 텍스트 검출 방법의 한계를 해결한다.
  • 개별 문자가 아닌 텍스트 라인을 컨volutional 특징 맵에서 직접 검출함으로써 스트리트 텍스트의 로컬라이제이션 정확도를 향상시킨다.
  • 순차적 제안에 대한 텍스트 존재 여부, 위치, 보정 오프셋을 동시에 예측하는 딥 네트워크의 엔드 투 엔드 훈련을 가능하게 한다.
  • 추가적인 후처리나 언어별 적응이 필요 없이 다중 스케일 및 다중 언어 텍스트에 대해 강건성을 향상시킨다.
  • 기준 데이터셋에서 높은 성능을 달성하면서도 실시간 추론을 위한 계산 효율성을 유지한다.

제안 방법

  • 특징 맵의 높이 전역에 걸쳐 고정 너비의 텍스트 제안을 생성하는 수직 앵커 메커니즘을 제안하며, 각 앵커는 텍스트/비텍스트 점수와 y축 좌표를 예측한다.
  • 수평 방향으로 인접한 제안 간의 순차적 의존성을 모델링하기 위해 양방향 장기 단기 기억망(BLSTM)을 통합하여 맥락 인식 검출을 가능하게 한다.
  • 사전 훈련된 VGG16 네트워크의 마지막 컨volutional 레이어(conv5)를 입력으로 사용하며, 각 제안에 대해 3×3 슬라이딩 윈도우를 적용해 局부 특징을 추출한다.
  • 각 제안의 특징을 왼쪽에서 오른쪽, 오른쪽에서 왼쪽으로의 맥락을 인코딩하기 위해 양방향 RNN 아키텍처를 사용하는 이중 스트림 구조를 적용하여 로컬라이제이션 정밀도를 향상시킨다.
  • 분류(텍스트/비텍스트), 바운딩 박스 회귀(y좌표 및 측면 보정), 시퀀스 모델링을 결합한 공동 손실 함수를 사용해 전체 네트워크를 엔드 투 엔드로 훈련한다.
  • 추론 시 오직 한 번의 비최대 억제(NMS)만을 적용하여 겹치는 제안을 억제함으로써 복잡한 후처리 파이프라인에 대한 의존도를 줄인다.

실험 결과

연구 질문

  • RQ1딥 네트워크가 문자 수준 검출에 의존하지 않고 컨volutional 특징 맵에서 직접 완전한 텍스트 라인을 검출할 수 있는가?
  • RQ2독립적인 제안 예측과 비교해 시퀀스 제안의 순환 모델링이 스트리트 텍스트 검출에서 로컬라이제이션 정확도를 어떻게 향상시키는가?
  • RQ3공동 회귀 및 분류를 수행하는 수직 앵커 메커니즘이 도전적인 다중 스케일 및 다중 언어 텍스트에서 검출 성능을 얼마나 향상시키는가?
  • RQ4엔드 투 엔드 훈련 가능한 아키텍처가 정확도와 효율성 측면에서 다단계 후처리 방법을 초월할 수 있는가?
  • RQ5특징 추출 파이프라인 내부에 RNN을 통합하면 모호하거나 소규모 텍스트의 검출 성능을 향상시킬 수 있는가?

주요 결과

  • CTPN은 ICDAR 2013 기준에서 F-측도 0.88을 달성하여 이전 최신 기준 방법보다 유의미한 격차로 앞서며 성능을 뛰어넘었다.
  • ICDAR 2015 기준에서 F-측도 0.61을 기록하여 다양한 어려운 텍스트 인스턴스에 대한 강력한 일반화 능력을 입증하였다.
  • 매우 소규모이거나 모호한 텍스트 라인을 높은 정확도로 검출하였으며, 일부 경우에서는 지상 진술(ground truth) 애너테이션을 초월하는 성능을 보였다.
  • VGG16 백본을 사용할 경우 이미지당 추론 시간이 0.14초로, 실시간 응용에 있어 계산적으로 효율적이다.
  • 언어별 적응이 필요 없이 다국어 텍스트, 특히 중국어 및 한국어에 대해서도 잘 일반화된다.
  • 후처리에 대한 의존도를 줄임으로써 파이프라인을 단순화하고, 순차적 단계에서의 오차 누적을 최소화하여 강건성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.