Skip to main content
QUICK REVIEW

[논문 리뷰] An Analysis of Pre-Training on Object Detection

Hengduo Li, Bharat Singh|arXiv (Cornell University)|2019. 04. 11.
Advanced Neural Network Applications참고 문헌 59인용 수 33
한 줄 요약

이 논문은 객체 탐지를 위한 CNN의 사전 학습이 (이미지 분류와 비교하여) 탐지, 세분화, 분류로의 transfer에 어떤 영향을 주는지 분석하여, 탐지 사전학습이 위치 추정 작업에서 우수하지만 분류에 해를 끼칠 수 있음을 보여준다.

ABSTRACT

We provide a detailed analysis of convolutional neural networks which are pre-trained on the task of object detection. To this end, we train detectors on large datasets like OpenImagesV4, ImageNet Localization and COCO. We analyze how well their features generalize to tasks like image classification, semantic segmentation and object detection on small datasets like PASCAL-VOC, Caltech-256, SUN-397, Flowers-102 etc. Some important conclusions from our analysis are --- 1) Pre-training on large detection datasets is crucial for fine-tuning on small detection datasets, especially when precise localization is needed. For example, we obtain 81.1% mAP on the PASCAL-VOC dataset at 0.7 IoU after pre-training on OpenImagesV4, which is 7.6% better than the recently proposed DeformableConvNetsV2 which uses ImageNet pre-training. 2) Detection pre-training also benefits other localization tasks like semantic segmentation but adversely affects image classification. 3) Features for images (like avg. pooled Conv5) which are similar in the object detection feature space are likely to be similar in the image classification feature space but the converse is not true. 4) Visualization of features reveals that detection neurons have activations over an entire object, while activations for classification networks typically focus on parts. Therefore, detection networks are poor at classification when multiple instances are present in an image or when an instance only covers a small fraction of an image.

연구 동기 및 목표

  • 대상은 물체 탐지 사전학습이 탐지, 세분화, 분류 작업으로 일반화되는지 평가하는 것.
  • 여러 대상 데이터셋에서 탐지-사전학습과 분류-사전학습을 비교한다.
  • 내부 특징 표현과 위치 추정 대 분류 능력을 이해한다.
  • 데이터셋 크기와 경계 상자 주석이 전이 성능에 어떤 영향을 미치는지 평가한다.

제안 방법

  • 대형 탐지 데이터셋(OpenImages, ImageNet-Loc, COCO)에서 CNN 백본을 사전 학습시키고 ImageNet-Cls 사전학습과 비교한다.
  • Pascal-Voc에서 탐지 및 세분화를 위해 사전 학습된 모델을 미세 조정하고, Caltech-256, Sun-397, Oxford-102 Flowers에서 분류를 위해 미세 조정한다.
  • SNIPER-시대의 검출기와 표준 미세 조정 일정 및 데이터 증강을 사용한다.
  • 다수의 IoU 임계값(0.1에서 0.7까지)에서 위치 추정 성능을 분석하고 트리맵 실험을 통해 경계(boundary) 대 비경계(boundary 아님) 동작을 정량화한다.
  • 활성화 시각화와 특징 공간 분석(예: Conv5 유사도, t-SNE, 클러스터링)을 수행하여 탐지 표현과 분류 표현을 비교한다.

실험 결과

연구 질문

  • RQ1대규모 탐지 데이터셋에서의 사전 학습이 작은 탐지 데이터셋의 미세 조정 성능과 높은 IoU 로컬라이제이션에 도움이 되는가?
  • RQ2탐지 사전 학습이 의미론적 분할과 이미지 분류 성능에 어떤 영향을 미치는가?
  • RQ3탐지-사전 학습 및 분류-사전 학습 네트워크 간의 내부 특징과 활성화의 차이는 무엇인가?
  • RQ4탐지 특징 공간의 유사성이 분류 특징 공간의 유사성을 예측하는가?
  • RQ5사전 학습 데이터셋의 크기와 경계 상자 풍부도가 전이 역학에 어떤 영향을_m미치는가?

주요 결과

  • 대규모 탐지 데이터셋에서의 사전 학습은 Pascal-Voc 객체 탐지의 mAP를 높은 IoU에서 Imagenet 사전 학습 대비 최대 약 7.6% 상대적으로 향상시킬 수 있으며(예를 들어 OpenImages에서 0.7 IoU의 81.1% mAP).
  • 탐지 사전 학습은 Pascal-Voc 2012에서 의미론적 분할의 약 3% 이익을 얻는다.
  • 탐지 사전 학습은 분류를 위한 분류 특징을 미세 조정 없이 사용할 때 Caltech-256에서 이미지 분류 성능에 약 8% 하락을 초래한다.
  • 두 이미지가 비슷한 탐지 특징을 가지면 분류 특징도 비슷할 가능성이 있지만 그 반대는 아니다.
  • 활성화 시각화는 탐지 네트워크가 전체 객체 표현을 사용하고 분류 네트워크는 판별적인 부분에 집중하여 폐색이나 다수의 인스턴스에 대한 강건성에 영향을 준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.