Skip to main content
QUICK REVIEW

[논문 리뷰] An Analysis of Scale Invariance in Object Detection - SNIP

Bharat Singh, Larry S. Davis|arXiv (Cornell University)|2017. 11. 22.
Advanced Neural Network Applications참고 문헌 34인용 수 14
한 줄 요약

이 논문은 이미지 피라미드 내에서 객체의 크기에 따라 그래디언트를 선택적으로 역전파하는 새로운 훈련 방식인 SNIP(Scale Normalization for Image Pyramids)을 제안한다. 이는 객체 검출에서 척도 불변성(스케일 인variant)을 향상시키기 위한 것이다. 사전 훈련된 ImageNet 모델의 척도 분포와 훈련을 일치시킴으로써, SNIP는 COCO에서 최신 기술 수준의 성능을 달성한다. 단일 모델로는 45.7% mAP, 앙상블로는 48.3% mAP를 기록했으며, 박스 좌표 감독만을 사용하고 표준 ImageNet 사전 훈련을 활용한다.

ABSTRACT

An analysis of different techniques for recognizing and detecting objects under extreme scale variation is presented. Scale specific and scale invariant design of detectors are compared by training them with different configurations of input data. By evaluating the performance of different network architectures for classifying small objects on ImageNet, we show that CNNs are not robust to changes in scale. Based on this analysis, we propose to train and test detectors on the same scales of an image-pyramid. Since small and large objects are difficult to recognize at smaller and larger scales respectively, we present a novel training scheme called Scale Normalization for Image Pyramids (SNIP) which selectively back-propagates the gradients of object instances of different sizes as a function of the image scale. On the COCO dataset, our single model performance is 45.7% and an ensemble of 3 networks obtains an mAP of 48.3%. We use off-the-shelf ImageNet-1000 pre-trained models and only train with bounding box supervision. Our submission won the Best Student Entry in the COCO 2017 challenge. Code will be made available at \url{http://bit.ly/2yXVg4c}.

연구 동기 및 목표

  • 딥 러닝의 발전에도 불구하고 객체 검출 성능이 이미지 분류 성능에 뒤처지는 이유를 탐구하기 위해.
  • 특히 작은 객체에 대해 CNN 기반 객체 검출기의 성능에 영향을 미치는 극단적인 척도 변동의 영향을 분석하기 위해.
  • 이미지 분류용으로 사전 훈련된 ImageNet 모델을 척도 분포가 크게 다른 검출 데이터셋에 맞추기 위해 미세조정할 때 발생하는 도메인 이탈 문제를 해결하기 위해.
  • 훈련 샘플의 다양성을 줄이지 않고도 척도 불변성을 향상시키는 훈련 체계를 개발하기 위해.
  • 사전 훈련된 ImageNet 모델을 소형 객체 검출에 효과적으로 활용할 수 있도록, 훈련 척도를 사전 훈련 분포와 일치시키기 위해.

제안 방법

  • SNIP는 입력 이미지의 다양한 해상도에 해당하는 다중 척도 이미지 피라미드에서 검출기를 훈련시킨다.
  • 이 방법은 사전 훈련된 ImageNet 모델의 척도와 유사한 척도를 가진 영역 제안(RoIs)에 대해서만 그래디언트를 선택적으로 역전파한다.
  • 이 척도 일치는 사전 훈련된 분류 네트워크와 검출 미세조정 단계 사이의 도메인 이탈을 최소화한다.
  • SNIP는 이미지 피라미드의 각 척도에서 별도로 작동하므로, 모든 척도에서의 객체 인스턴스를 모두 활용할 수 있다.
  • 이 방법은 다양한 검출 프레임워크(예: Faster R-CNN, R-FCN)에 적용할 수 있으며, 훈련 루프만 수정하면 된다.
  • 구조적 변경이나 박스 외 추가 감독이 필요 없으며, 탄성 컨볼루션과 Soft-NMS와 같은 기존 파ip라인과도 호환된다.

실험 결과

연구 질문

  • RQ1유사한 네트워크 아키텍처를 가졌음에도 불구하고 객체 검출 성능이 이미지 분류 성능에 뒤처지는 이유는 무엇인가?
  • RQ2COCO와 같은 데이터셋에서 극단적인 척도 변동이 CNN 기반 객체 검출기의 강건성에 어떤 영향을 미치는가?
  • RQ3사전 훈련된 ImageNet 분류기의 척도 분포가 검출 데이터셋과 크게 다를 경우, 이를 검출 데이터에 대해 미세조정할 때 성능 저하가 얼마나 발생하는가?
  • RQ4각 척도에서의 훈련 샘플 수를 줄이지 않고도 척도 불변성을 향상시킬 수 있는 훈련 체계를 설계할 수 있는가?
  • RQ5척도 기반으로 선택적으로 그래디언트를 역전파하는 방식이, 특히 소형 객체에 대해 검출 성능 향상에 기여하는가?

주요 결과

  • SNIP는 COCO test-dev에서 단일 모델로 45.7% mAP를 기록했으며, 최고의 단일 모델 베이스라인보다 전반적으로 2.5% 향상되었고, 소형 객체에 대해서는 3.9% 향상되었다.
  • SNIP를 사용한 3개의 네트워크 앙상블는 mAP 48.3%를 기록하여 COCO 2017 챌린지에서 새로운 최신 기술 수준을 수립했다.
  • 소형 객체(≤25 픽셀)의 리콜은 6.3% 향상되었고, 모든 객체의 리콜은 50% IoU에서 2.9% 향상되어 어려운 케이스에서 뚜렷한 성과를 보였다.
  • RPN 및 RCN 헤드에서 SNIP를 제거하면 DPN-98 백본을 사용할 때 mAP가 3.5% 감소하여 SNIP의 성능 향상에 핵심적인 역할을 함을 확인했다.
  • SNIP는 단일 척도 RPN 및 RCN 헤드에서도 강력한 성능을 발휘하며, 피처 피라미드 없이도 Faster R-CNN과 탄성 컨볼루션을 사용해 44.4% mAP를 달성했다.
  • SNIP는 다양한 백본 아키텍처에서 효과적이며, DPN-98 및 DPN-92 모두 SNIP와 함께 사용할 경우 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.