Skip to main content
QUICK REVIEW

[논문 리뷰] FC2RN: A Fully Convolutional Corner Refinement Network for Accurate Multi-Oriented Scene Text Detection

Xugong Qin, Yu Zhou|arXiv (Cornell University)|2020. 07. 10.
Handwritten Text Recognition Techniques참고 문헌 58인용 수 6
한 줄 요약

FC2RN은 새로운 사각형 RoI 컨volution(QRC) 연산을 통해 초기 사각형 예측을 보정함으로써 다중 방향의 영상 텍스트 검출 성능을 향상시키는 완전 컨볼루션형 코너 보정 네트워크를 제안한다. 이는 긴 길이와 다양한 방향을 가진 텍스트의 정확한 국소화를 가능하게 한다. 이 방법은 최소한의 계산 오버헤드로 네 가지 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Recent scene text detection works mainly focus on curve text detection. However, in real applications, the curve texts are more scarce than the multi-oriented ones. Accurate detection of multi-oriented text with large variations of scales, orientations, and aspect ratios is of great significance. Among the multi-oriented detection methods, direct regression for the geometry of scene text shares a simple yet powerful pipeline and gets popular in academic and industrial communities, but it may produce imperfect detections, especially for long texts due to the limitation of the receptive field. In this work, we aim to improve this while keeping the pipeline simple. A fully convolutional corner refinement network (FC2RN) is proposed for accurate multi-oriented text detection, in which an initial corner prediction and a refined corner prediction are obtained at one pass. With a novel quadrilateral RoI convolution operation tailed for multi-oriented scene text, the initial quadrilateral prediction is encoded into the feature maps which can be further used to predict offset between the initial prediction and the ground-truth as well as output a refined confidence score. Experimental results on four public datasets including MSRA-TD500, ICDAR2017-RCTW, ICDAR2015, and COCO-Text demonstrate that FC2RN can outperform the state-of-the-art methods. The ablation study shows the effectiveness of corner refinement and scoring for accurate text localization.

연구 동기 및 목표

  • 자연계 영상에서 다중 방향, 긴 길이, 척도가 변하는 텍스트의 정확한 검출 문제를 해결하기 위해.
  • 제한된 수신 영역과 긴 텍스트에서 국소화 성능이 열 劣한 직접 회귀 기반 텍스트 검출기의 문제를 개선하기 위해.
  • 코너 보정을 통해 정확도를 향상시키면서도 단순하고 종단 간(end-to-end), 앵커 기반 아님 파이프라인을 유지하기 위해.
  • 기존 검출기와 원활하게 통합될 수 있는 경량이고 완전 컨볼루션형 모듈을 설계하기 위해.

제안 방법

  • 직접 회귀를 통해 초기 사각형 예측을 수행하는 완전 컨볼루션형 코너 보정 네트워크(FC2RN)를 제안한다.
  • 새로운 사각형 RoI 컨볼루션(QRC) 연산은 초깃값 예측을 특징 맵으로 인코딩하여 공간적으로 인지 가능한 보정을 가능하게 한다.
  • QRC 모듈은 예측된 사각형 코너 주변의 특징을 경량 변형 가능 컨볼루션으로 샘플링하여 보정을 위한 맥락을 캡처한다.
  • 네트워크는 초깃값 예측의 오프셋 보정과 개선된 신뢰도 점수를 동시에 예측하여 국소화 정확도와 검출 품질을 향상시킨다.
  • 보정 헤드는 완전 컨볼루션 구조이므로, 비가역적인 연산 없이 종단 간(end-to-end) 훈련 및 배포가 가능하다.
  • 이 방법은 플러그 앤 플레이 방식이므로, EAST와 같은 기존 앵커 기반 아님 검출기에 아키텍처의 대대적 개편 없이 쉽게 통합될 수 있다.

실험 결과

연구 질문

  • RQ1특징 인코딩을 통한 코너 보정이 다중 방향 텍스트, 특히 긴 길이와 비정형 형태의 텍스트에 대해 국소화 정확도를 향상시킬 수 있는가?
  • RQ2경량이고 완전 컨볼루션형 보정 모듈은 높은 효율성을 유지하면서도 기존의 직접 회귀 기반 검출기보다 뛰어난 성능을 낼 수 있는가?
  • RQ3표준 RoI 풀링과 비교해 본다면, 제안된 QRC 연산이 사각형 예측을 위한 공간 맥락을 얼마나 잘 캡처하는가?
  • RQ4보정 메커니즘이 큰 종횡비를 가진 긴 텍스트 라인에서 잡음(오류)을 줄이고 재현율을 향상시킬 수 있는가?
  • RQ5다양한 텍스트 방향과 척도를 가진 다양한 벤치마크에서 보정 모듈이 성능 향상에 얼마나 기여하는가?

주요 결과

  • 단일 척도 테스트에서 MSRA-TD500에서 88.9 F-측정치를 기록하여, 더 깊은 ResNet152 백본을 사용하는 GNNets를 포함한 최신 기술 수준(SOTA) 방법들을 초월한다.
  • ICDAR2017-RCTW에서 88.7%의 재현율을 기록하여 이전 SOTA 방법인 GNNets에 비해 약 2% 향상된 성능을 달성한다.
  • COCO-Text에서 IoU 0.5일 때 63.0 F-측정치, IoU 0.75일 때 37.3 F-측정치를 기록하여 RRD 및 Mask TextSpotter와 같은 다중 척도 방법들을 능가한다.
  • IoU 0.75일 때 RRD 대비 1.3 F-측정치 향상으로 사각형 국소화 정확도가 뛰어나다는 것을 확인한다.
  • 추가 파rameter가 0.61M개이고 계산량이 50.3 GMac에 불과함에도 불구하고, 1280×800 해상도에서 5.8 FPS의 높은 속도를 유지한다.
  • 제거 실험(ablation study) 결과, 코너 보정과 신뢰도 점수 예측이 모두 국소화 정확도 향상에 기여하며, 특히 긴 텍스트 인스턴스에서 두드러진 효과를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.