Skip to main content
QUICK REVIEW

[논문 리뷰] Recurrent Scale Approximation for Object Detection in CNN

Yu Liu, Hongyang Li|arXiv (Cornell University)|2017. 07. 29.
Advanced Neural Network Applications참고 문헌 34인용 수 6
한 줄 요약

이 논문은 단일 순방향 전파를 통해 컨volutional 네트워크(CNN)에서 다중 척도 객체 검출을 위한 특징 맵을 계산하는 데에 Recurrent Scale Approximation (RSA)를 제안한다. 초기 대규모 맵에서 반복적으로 더 작은 척도의 특징을 근사하고, 척도 예측 네트워크와 지점 재추적 네트워크(LRN)를 통해 향상시킴으로써 RSA는 매우 낮은 계산 비용으로 최신 기술 수준의 얼굴 검출 성능을 달성한다.

ABSTRACT

Since convolutional neural network (CNN) lacks an inherent mechanism to handle large scale variations, we always need to compute feature maps multiple times for multi-scale object detection, which has the bottleneck of computational cost in practice. To address this, we devise a recurrent scale approximation (RSA) to compute feature map once only, and only through this map can we approximate the rest maps on other levels. At the core of RSA is the recursive rolling out mechanism: given an initial map at a particular scale, it generates the prediction at a smaller scale that is half the size of input. To further increase efficiency and accuracy, we (a): design a scale-forecast network to globally predict potential scales in the image since there is no need to compute maps on all levels of the pyramid. (b): propose a landmark retracing network (LRN) to trace back locations of the regressed landmarks and generate a confidence score for each landmark; LRN can effectively alleviate false positives caused by the accumulated error in RSA. The whole system can be trained end-to-end in a unified CNN framework. Experiments demonstrate that our proposed algorithm is superior against state-of-the-art methods on face detection benchmarks and achieves comparable results for generic proposal generation. The source code of RSA is available at github.com/sciencefans/RSA-for-object-detection.

연구 동기 및 목표

  • 특징 맵을 척도 간에 반복적으로 계산하는 방식으로 인해 다중 척도 객체 검출의 높은 계산 비용 문제를 해결한다.
  • 기본적인 다중 척도 추론 파이프라인에서 발생하는 중복 계산을 유발하는 CNN의 척도 변화 처리 능력 부족 문제를 해결한다.
  • 단일 초기 특징 맵에서 여러 척도의 특징 맵을 근사하는 방법을 개발하여 계산 오버헤드를 최소화하면서도 검출 정확도를 유지한다.
  • 반복적 척도 근사에서 발생하는 오차 누적로 인한 잘못된 검출을 줄이기 위해 신뢰도를 향상시켜 검출 신뢰성을 높인다.
  • 척도 예측, 특징 근사, 신뢰도 개선을 통합한 종단간 훈련이 가능한 통합 프레임워크를 개발한다.

제안 방법

  • 입력 맵의 공간 크기의 절반 크기의 특징 맵을 반복적으로 생성하는 Recurrent Scale Approximation (RSA) 유닛을 도입하여 단일 순방향 전파로 척도 근사를 가능하게 한다.
  • 이미지 내에서 가장 관련성이 높은 객체 척도를 예측하기 위해 척도 예측 네트워크를 설계하여 관련이 없는 척도에서 특징 맵 생성을 방지함으로써 계산을 줄인다.
  • RSA 레이어를 통해 지점의 위치를 역추적하고 오차 누적로 인한 잘못된 검출을 줄이기 위해 신뢰도 점수를 할당하는 지점 재추적 네트워크(LRN)를 제안한다.
  • RSA, 척도 예측, LRN을 통합하여 종단간 훈련이 가능한 단일 CNN 프레임워크로 통합한다.
  • 연속 평가 환경에서 성능을 향상시키기 위해 바운딩 박스 애너테이션(예: FDDB에서 타원형)을 직사각형 예측으로 정렬하기 위해 트랜스포머를 적용한다.
  • RSA 프레임워크를 얼굴 검출과 일반적인 객체 제안 생성(RPN on ILSVRC 등)에 적용하여 다양한 작업에 대한 일반화 능력을 입증한다.

실험 결과

연구 질문

  • RQ1CNN 기반 객체 검출기에서 단일 초기 특징 맵으로부터 여러 척도의 특징 맵을 효과적으로 근사할 수 있는가?
  • RQ2검출 정확도를 희생시키지 않고 다중 척도 객체 검출의 계산 효율성을 어떻게 향상시킬 수 있는가?
  • RQ3이미지 내에서 관련 있는 척도만 예측함으로써 척도 예측 네트워크가 얼마나 많은 중복 계산을 줄일 수 있는가?
  • RQ4지점 재추적 네트워크는 반복적 척도 근사에서 발생하는 오차 누적으로 인한 잘못된 검출을 얼마나 효과적으로 완화할 수 있는가?
  • RQ5RSA 프레임워크는 얼굴 검출을 넘어 일반적인 객체 검출에도 일반화 가능한가?

주요 결과

  • FDDB 벤치마크에서 제안된 RSA+LRN 방법은 오직 50개의 잘못된 검출만을 기록하면서 93.0%의 리콜을 달성하여 최신 기술 수준의 방법을 초월한다.
  • AFW 데이터셋에서 이 방법은 원본 애너테이션을 사용할 경우 99.17%의 AP를 기록하고, 수정된 애너테이션을 사용할 경우 99.96%의 AP를 기록하여 도전적인 얼굴 검출 환경에서도 높은 정확도를 입증한다.
  • MALF 벤치마크에서 이 방법은 잘못된 검출이 전혀 없는 82.4%의 리콜을 기록하여 뛰어난 정밀도와 강건성을 보여준다.
  • RSA+RPN 변종은 ILSVRC DET val2에서 단일 척도 RPN 대비 계산 비용을 61.05% 감소시켰으며, 리콜은 유지하거나 향상시켰다.
  • RSA 프레임워크는 ILSVRC에서 이미지당 추론 시간을 단 124ms로 줄였고, 단일 척도 RPN의 249ms 대비 뚜렷한 속도 향상을 보였다.
  • 척도 예측 네트워크는 관련 있는 척도를 효과적으로 식별하여 배경이 지배하는 척도에서의 특징 맵 생성을 방지함으로써 계산을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.