[논문 리뷰] An Anchor-Free Region Proposal Network for Faster R-CNN based Text Detection Approaches
이 논문은 Faster R-CNN의 앵커 기반 RPN을 대체하는 앵커리스 영역 제안 네트워크(AF-RPN)를 제안한다. 이는 키포인트 회귀를 통해 텍스트 인스턴스를 직접 예측함으로써 수동 앵커 설계가 필요 없도록 한다. 단일 ResNet-50 백본과 단일 스케일 테스트를 사용하여 ICDAR-2013, ICDAR-2015, ICDAR-2017 벤치마크에서 최신 기술 성능을 달성하며, COCO-Text에서 더 높은 리콜을 기록하고 검출 정확도가 향상된다.
The anchor mechanism of Faster R-CNN and SSD framework is considered not effective enough to scene text detection, which can be attributed to its IoU based matching criterion between anchors and ground-truth boxes. In order to better enclose scene text instances of various shapes, it requires to design anchors of various scales, aspect ratios and even orientations manually, which makes anchor-based methods sophisticated and inefficient. In this paper, we propose a novel anchor-free region proposal network (AF-RPN) to replace the original anchor-based RPN in the Faster R-CNN framework to address the above problem. Compared with a vanilla RPN and FPN-RPN, AF-RPN can get rid of complicated anchor design and achieve higher recall rate on large-scale COCO-Text dataset. Owing to the high-quality text proposals, our Faster R-CNN based two-stage text detection approach achieves state-of-the-art results on ICDAR-2017 MLT, ICDAR-2015 and ICDAR-2013 text detection benchmarks when using single-scale and single-model (ResNet50) testing only.
연구 동기 및 목표
- 장면 텍스트 검출에서 앵커 기반 영역 제안 네트워크의 비효율성과 복잡성을 해결하기 위해.
- 다양한 척도, 종횡비, 방향성을 가진 앵커의 수동 설계가 필요 없도록 하기 위해.
- 앵커 기반 RPN을 앵커리스 대체품으로 교체함으로써 장면 텍스트 데이터셋에서 리콜과 검출 정확도를 향상시키기 위해.
- 단일 모델과 단일 스케일 입력을 사용하여 표준 텍스트 검출 벤치마크에서 최신 기술 성능을 달성하기 위해.
제안 방법
- 사전 정의된 앵커 없이 텍스트 인스턴스를 직접 예측하는 앵커리스 영역 제안 네트워크(AF-RPN)를 제안한다.
- 텍스트 인스턴스의 왼쪽 위 및 오른쪽 아래 모서리를 키포인트 회귀를 통해 예측함으로써 엔드 투 엔드 예측을 가능하게 한다.
- 다양한 크기의 텍스트를 탐지하기 위해 다중 척도 특징 표현을 향상시키기 위해 특징 피라미드 네트워크(FPN) 구조를 채택한다.
- Faster R-CNN의 앵커 기반 매칭 기준을 지정된 앵커 없이 지능적으로 작동하는, 정답 박스 좌표 기반의 학습 가능한 회귀 전략으로 대체한다.
- 키포인트 기반 회귀에 적합하게 수정된 표준 RPN 손실 함수를 사용하여 AF-RPN을 Faster R-CNN 프레임워크 내에서 엔드 투 엔드로 훈련한다.
- 추론 효율성을 유지하면서 높은 성능을 달성하기 위해 단일 스케일 입력과 ResNet-50 백본을 활용한다.
실험 결과
연구 질문
- RQ1앵커리스 영역 제안 네트워크가 장면 텍스트 검출에서 앵커 기반 RPN을 능가할 수 있는가?
- RQ2수동 앵커 설계를 제거하면 도전적인 텍스트 검출 벤치마크에서 리콜과 검출 정확도가 향상되는가?
- RQ3단일 모델, 단일 스케일 추론 설정이 앵커리스 접근법을 사용하여 최신 기술 성능을 달성할 수 있는가?
- RQ4다양한 텍스트 형태와 방향성을 가진 데이터셋에서 AF-RPN은 앵커 기반 기준 모델보다 어떻게 성능을 내는가?
주요 결과
- AF-RPN은 대규모 COCO-Text 데이터셋에서 바닐라 RPN과 FPN-RPN보다 더 높은 리콜률을 기록한다.
- 단일 ResNet-50 모델과 단일 스케일 입력만을 사용하여 ICDAR-2017 MLT 벤치마크에서 새로운 최신 기술 성능을 수립한다.
- ICDAR-2015 및 ICDAR-2013 벤치마크에서 경쟁력 있는 성능을 기록하며, 동일한 평가 프로토콜 하에서 기존의 앵커 기반 접근법을 초월한다.
- 앵커리스 설계 덕분에 앵커 척도 및 종횡비의 광범위한 하이퍼파라미터 튜닝이 필요 없어져 파ip라인의 단순화가 이뤄진다.
- 앵커 생성 및 매칭 단계가 없기 때문에 높은 추론 효율성을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.