Skip to main content
QUICK REVIEW

[논문 리뷰] RRPN++: Guidance Towards More Accurate Scene Text Detection

Jianqi Ma|arXiv (Cornell University)|2020. 09. 28.
Handwritten Text Recognition Techniques참고 문헌 54인용 수 4
한 줄 요약

RRPN++는 효율적이고 스케일 적응형 프로포절 생성을 위한 앵커 없는 피라미드 프로포절 네트워크(APPN)를 도입하고, 다중 작업 학습과 공동 필터링을 위한 인식 브랜치를 통합함으로써 시나리오 텍스트 검출을 향상시킨다. 이는 ICDAR2015에서 RRPN 대비 6%의 F-측도 향상을 이끌어내며, 더 빠른 추론 속도를 기록하여 최신 기술 수준의 성능을 달성한다.

ABSTRACT

RRPN is among the outstanding scene text detection approaches, but the manually-designed anchor and coarse proposal refinement make the performance still far from perfection. In this paper, we propose RRPN++ to exploit the potential of RRPN-based model by several improvements. Based on RRPN, we propose the Anchor-free Pyramid Proposal Networks (APPN) to generate first-stage proposals, which adopts the anchor-free design to reduce proposal number and accelerate the inference speed. In our second stage, both the detection branch and the recognition branch are incorporated to perform multi-task learning. In inference stage, the detection branch outputs the proposal refinement and the recognition branch predicts the transcript of the refined text region. Further, the recognition branch also helps rescore the proposals and eliminate the false positive proposals by the jointing filtering strategy. With these enhancements, we boost the detection results by $6\%$ of F-measure in ICDAR2015 compared to RRPN. Experiments conducted on other benchmarks also illustrate the superior performance and efficiency of our model.

연구 동기 및 목표

  • RRPN의 한계, 특히 수작업으로 설계된 앵커에 대한 의존성과 둔한 프로포절 보정을 해결하기 위해.
  • 앵커 기반 프로포절을 앵커 없는 다중 스케일 프로포절 네트워크로 대체하여 검출 정확도와 추론 속도를 향상시키기 위해.
  • 다중 작업 학습을 통해 인식 감독 신호를 활용하여 검출 성능 향상을 위한 지도 신호로 활용하기 위해.
  • 검출 점수와 인식 신뢰도를 함께 사용하여 공동 필터링을 통해 잡음(거짓 양성)을 줄이기 위해.
  • ICDAR2013, ICDAR2015, COCO-Text를 포함한 여러 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 앵커 템플릿 없이 특징 맵에서 직접 프로포절을 생성하는 앵커 없는 피라미드 프로포절 네트워크(APPN)를 제안하여 프로포절 수를 줄이고 추론 속도를 향상시킨다.
  • 다중 스케일 텍스트 인스턴스에 대해 서로 다른 피처 피라미드 수준에 레이블을 할당하여 균형 잡히고 효율적인 다중 스케일 검출 학습을 가능하게 한다.
  • 검출 헤드에 인식 브랜치를 통합하여 엔드 투 엔드 다중 작업 학습을 가능하게 하며, 인식 결과가 검출 보정을 유도한다.
  • 정확한 특징 표현을 추출하기 위해 RRoI Align을 사용하여 프로포절 보정 성능을 향상시킨다.
  • 검출 점수와 인식 신뢰도를 함께 사용하여 프로포절을 재평가하고 잡음(거짓 양성)을 제거하기 위해 공동 필터링을 적용한다.
  • 두 단계 추론 파이프라인을 사용한다: 첫 번째 단계에서 APPN로부터 프로포절을 생성하고, 두 번째 단계에서 검출 브랜치와 인식 브랜치에서 각각 보정 및 전사 예측을 수행한다.

실험 결과

연구 질문

  • RQ1앵커 기반 방법과 비교해 앵커 없는 프로포절 생성 메커니즘이 효율성과 정확도 측면에서 시나리오 텍스트 검출에 개선을 이끌 수 있는가?
  • RQ2다중 작업 학습을 통해 인식 브랜치를 통합하면 검출 성능가 어떻게 향상되는가?
  • RQ3검출 점수와 인식 점수를 함께 사용한 공동 필터링이 잡음(거짓 양성) 프로포절을 효과적으로 줄일 수 있는가?
  • RQ4제안된 APPN 설계가 다중 스케일 텍스트 검출 성능에 얼마나 기여하는가?
  • RQ5인식 감독의 통합이 표준 벤치마크에서 F-측도에 측정 가능한 성과 향상을 이끌 수 있는가?

주요 결과

  • RRPN++는 ICDAR2015 벤치마크에서 RRPN 대비 6%의 절대적인 F-측도 향상을 기록하여 F-측도 89.5%를 달성한다.
  • ICDAR2013에서는 모든 회귀 기반 방법 중에서 가장 높은 F-측도 92.0%를 기록하며, 추론 속도는 13.3 fps이다.
  • COCO-Text에서 RRPN++는 F-측도 64.6%를 기록하여 이전 최고 성능 기록을 1.6% 초과하며, 대부분의 이전 방법보다 빠른 속도를 기록한다.
  • 인식 브랜치는 정확도 최적화가 이루어지지 않았음에도 불구하고 검출 성능 향상에 크게 기여하여 상호 작업 감독의 가치를 입증한다.
  • 검출 점수와 인식 신뢰도를 함께 사용한 공동 필터링은 잡음(거짓 양성)을 효과적으로 줄여 전체 성능 향상에 기여한다.
  • 앵커 없는 APPN 설계로 프로포절 수가 감소하고 IoU 기반 레이블 할당이 필요 없어져 GPU 메모리 사용량이 감소하고 학습 효율성이 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.