Skip to main content
QUICK REVIEW

[논문 리뷰] Frustratingly Simple Few-Shot Object Detection

Xin Wang, Thomas E. Huang|arXiv (Cornell University)|2020. 03. 16.
Domain Adaptation and Few-Shot Learning참고 문헌 22인용 수 40
한 줄 요약

논문은Balanced한 기본(base) 및 새로운(novel) 클래스 세트에서 객체 탐지기의 마지막 계층만 미세조정하는 두 단계 미세조정(Two-stage fine-tuning)과 인스턴스 수준 특징 정규화 및 코사인 유사도 분류가 메타러닝 방법보다 소샷 객체 탐지에서 더 우수하다고 보여주며, VOC, COCO, LVIS 전반에 걸친 더 신뢰할 수 있는 벤치마크를 도입한다.

ABSTRACT

Detecting rare objects from a few examples is an emerging problem. Prior works show meta-learning is a promising approach. But, fine-tuning techniques have drawn scant attention. We find that fine-tuning only the last layer of existing detectors on rare classes is crucial to the few-shot object detection task. Such a simple approach outperforms the meta-learning methods by roughly 2~20 points on current benchmarks and sometimes even doubles the accuracy of the prior methods. However, the high variance in the few samples often leads to the unreliability of existing benchmarks. We revise the evaluation protocols by sampling multiple groups of training examples to obtain stable comparisons and build new benchmarks based on three datasets: PASCAL VOC, COCO and LVIS. Again, our fine-tuning approach establishes a new state of the art on the revised benchmarks. The code as well as the pretrained models are available at https://github.com/ucbdrive/few-shot-object-detection.

연구 동기 및 목표

  • 간단한 미세조정이 소샷 객체 탐 탐지에서 메타러닝보다 우수할 수 있는지 평가한다.
  • 훈련 일정(schedule)과 인스턴스 수준 특징 정규화가 탐지 성능에 미치는 영향을 조사한다.
  • 소샷 설정에서 가변성 및 기본 클래스 지식 보유를 다루기 위한 평가 프로토콜을 수정한다.

제안 방법

  • 기초 탐지기로 Faster R-CNN을 채택하고 학습을 기본(base) 및 소샷(few-shot) 단계로 나누는 이단계 미세조정(TFA)을 적용한다.
  • 1단계에서 기본 클래스에 대해 탐지기를 학습하고, 2단계에서 특징 추출기를 고정하고 상자 예측기의 마지막 계층만 기본 및 새로운(base+novel) 클래스로 균형 있게 미세조정한다.
  • 두 번째 단계에서 상자 분류기 내에서 인스턴스 수준 특징 정규화를 적용하여 클래스 간 분산을 줄인다.
  • 제안된 제안들을 코사인 유사도 기반의 상자 분류기로 평가하며 고정된 스케일링 파라미터 알파(alpha, 경험적으로 20)를 사용한다.
  • 메타러닝 기반 기준선(FSRW, Meta R-CNN, MetaDet)과 완전한 미세조정 또는 공동 학습 기준선과 비교한다.
  • 벤치마크를 여러 학습 그룹 샘플링으로 수정하고 VOC, COCO, LVIS에서 기본 클래스 AP, 새로운 클래스 AP, 일반화 AP를 보고한다.

실험 결과

연구 질문

  • RQ1기본+새로운 세트를 균형 있게 구성한 경우 탐지기의 마지막 계층만 미세조정하는 것이 소샷 객체 탐지에서 메타러닝 방법보다 우수한가?
  • RQ2어떤 학습 메커니즘(스케줄, 정규화, 코사인 분류기)이 소샷 탐지 성능을 가장 안정적이고 향상시키는가?
  • RQ3개정된 평가 프로토콜이 VOC, COCO, LVIS의 소샷 탐지에서 신뢰성과 비교에 어떤 영향을 미치는가?

주요 결과

  • 두 단계 미세조정(TFA)은 VOC와 COCO 벤치마크에서 약 2~20 AP 포인트를 기준으로 이전 메타러닝 방법보다 일관되게 우수하다.
  • 인스턴스 수준 정규화를 포함한 코사인 유사도 기반 상자 분류기를 사용하면 특히 매우 적은 샷(1-shot)에서 신규 클래스 AP가 더 개선된다.
  • LVIS에서 TFA는 희소 클래스 AP를 약 4 포인트, 일반 클래스 AP를 약 2 포인트 개선하며 잦은 클래스에 미치는 영향은 미미하다.
  • 수정된 벤치마크는 소샷 탐지 결과의 분산이 큼을 보여주며, 서로 다른 샘플링 그룹으로의 다수 실행이 더 안정적이고 신뢰할 수 있는 비교를 제공한다.
  • VOC, COCO, LVIS 전반에서 수정된 평가 프로토콜 하에 TFA가 새로운 최첨단 결과를 확립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.