Skip to main content
QUICK REVIEW

[논문 리뷰] An Anchor-Free Region Proposal Network for Faster R-CNN based Text Detection Approaches

Zhuoyao Zhong, Lei Sun|arXiv (Cornell University)|2018. 04. 24.
Handwritten Text Recognition Techniques참고 문헌 15인용 수 16
한 줄 요약

이 논문은 Faster R-CNN의 앵커 기반 RPN을 대체하는 앵커리스 영역 제안 네트워크(AF-RPN)를 제안한다. 이는 키포인트 회귀를 통해 텍스트 인스턴스를 직접 예측함으로써 수동 앵커 설계가 필요 없도록 한다. 단일 ResNet-50 백본과 단일 스케일 테스트를 사용하여 ICDAR-2013, ICDAR-2015, ICDAR-2017 벤치마크에서 최신 기술 성능을 달성하며, COCO-Text에서 더 높은 리콜을 기록하고 검출 정확도가 향상된다.

ABSTRACT

The anchor mechanism of Faster R-CNN and SSD framework is considered not effective enough to scene text detection, which can be attributed to its IoU based matching criterion between anchors and ground-truth boxes. In order to better enclose scene text instances of various shapes, it requires to design anchors of various scales, aspect ratios and even orientations manually, which makes anchor-based methods sophisticated and inefficient. In this paper, we propose a novel anchor-free region proposal network (AF-RPN) to replace the original anchor-based RPN in the Faster R-CNN framework to address the above problem. Compared with a vanilla RPN and FPN-RPN, AF-RPN can get rid of complicated anchor design and achieve higher recall rate on large-scale COCO-Text dataset. Owing to the high-quality text proposals, our Faster R-CNN based two-stage text detection approach achieves state-of-the-art results on ICDAR-2017 MLT, ICDAR-2015 and ICDAR-2013 text detection benchmarks when using single-scale and single-model (ResNet50) testing only.

연구 동기 및 목표

  • 장면 텍스트 검출에서 앵커 기반 영역 제안 네트워크의 비효율성과 복잡성을 해결하기 위해.
  • 다양한 척도, 종횡비, 방향성을 가진 앵커의 수동 설계가 필요 없도록 하기 위해.
  • 앵커 기반 RPN을 앵커리스 대체품으로 교체함으로써 장면 텍스트 데이터셋에서 리콜과 검출 정확도를 향상시키기 위해.
  • 단일 모델과 단일 스케일 입력을 사용하여 표준 텍스트 검출 벤치마크에서 최신 기술 성능을 달성하기 위해.

제안 방법

  • 사전 정의된 앵커 없이 텍스트 인스턴스를 직접 예측하는 앵커리스 영역 제안 네트워크(AF-RPN)를 제안한다.
  • 텍스트 인스턴스의 왼쪽 위 및 오른쪽 아래 모서리를 키포인트 회귀를 통해 예측함으로써 엔드 투 엔드 예측을 가능하게 한다.
  • 다양한 크기의 텍스트를 탐지하기 위해 다중 척도 특징 표현을 향상시키기 위해 특징 피라미드 네트워크(FPN) 구조를 채택한다.
  • Faster R-CNN의 앵커 기반 매칭 기준을 지정된 앵커 없이 지능적으로 작동하는, 정답 박스 좌표 기반의 학습 가능한 회귀 전략으로 대체한다.
  • 키포인트 기반 회귀에 적합하게 수정된 표준 RPN 손실 함수를 사용하여 AF-RPN을 Faster R-CNN 프레임워크 내에서 엔드 투 엔드로 훈련한다.
  • 추론 효율성을 유지하면서 높은 성능을 달성하기 위해 단일 스케일 입력과 ResNet-50 백본을 활용한다.

실험 결과

연구 질문

  • RQ1앵커리스 영역 제안 네트워크가 장면 텍스트 검출에서 앵커 기반 RPN을 능가할 수 있는가?
  • RQ2수동 앵커 설계를 제거하면 도전적인 텍스트 검출 벤치마크에서 리콜과 검출 정확도가 향상되는가?
  • RQ3단일 모델, 단일 스케일 추론 설정이 앵커리스 접근법을 사용하여 최신 기술 성능을 달성할 수 있는가?
  • RQ4다양한 텍스트 형태와 방향성을 가진 데이터셋에서 AF-RPN은 앵커 기반 기준 모델보다 어떻게 성능을 내는가?

주요 결과

  • AF-RPN은 대규모 COCO-Text 데이터셋에서 바닐라 RPN과 FPN-RPN보다 더 높은 리콜률을 기록한다.
  • 단일 ResNet-50 모델과 단일 스케일 입력만을 사용하여 ICDAR-2017 MLT 벤치마크에서 새로운 최신 기술 성능을 수립한다.
  • ICDAR-2015 및 ICDAR-2013 벤치마크에서 경쟁력 있는 성능을 기록하며, 동일한 평가 프로토콜 하에서 기존의 앵커 기반 접근법을 초월한다.
  • 앵커리스 설계 덕분에 앵커 척도 및 종횡비의 광범위한 하이퍼파라미터 튜닝이 필요 없어져 파ip라인의 단순화가 이뤄진다.
  • 앵커 생성 및 매칭 단계가 없기 때문에 높은 추론 효율성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.