Skip to main content
QUICK REVIEW

[논문 리뷰] MM-FSOD: Meta and metric integrated few-shot object detection

Yuewen Li, Wenquan Feng|arXiv (Cornell University)|2020. 12. 30.
Domain Adaptation and Few-Shot Learning참고 문헌 37인용 수 8
한 줄 요약

이 논문은 미세튜닝 없이 빠르고 클래스에 종속되지 않는 새로운 종류의 객체 검출을 가능하게 하는 새로운 소수 샘플 객체 검출 프레임워크인 MM-FSOD를 제안한다. 메타학습과 거리 측정 학습을 통합하여, 메타표현 모듈과 피어슨 거리 기반 거리 측정 모듈을 도입함으로써, FSOD, COCO, PASCAL VOC에서 최고 성능을 기록하며, 5-shot 설정에서 AP50 기준으로 이전 방법들보다 최대 18% 향상되었다.

ABSTRACT

In the object detection task, CNN (Convolutional neural networks) models always need a large amount of annotated examples in the training process. To reduce the dependency of expensive annotations, few-shot object detection has become an increasing research focus. In this paper, we present an effective object detection framework (MM-FSOD) that integrates metric learning and meta-learning to tackle the few-shot object detection task. Our model is a class-agnostic detection model that can accurately recognize new categories, which are not appearing in training samples. Specifically, to fast learn the features of new categories without a fine-tuning process, we propose a meta-representation module (MR module) to learn intra-class mean prototypes. MR module is trained with a meta-learning method to obtain the ability to reconstruct high-level features. To further conduct similarity of features between support prototype with query RoIs features, we propose a Pearson metric module (PR module) which serves as a classifier. Compared to the previous commonly used metric method, cosine distance metric. PR module enables the model to align features into discriminative embedding space. We conduct extensive experiments on benchmark datasets FSOD, MS COCO, and PASCAL VOC to demonstrate the feasibility and efficiency of our model. Comparing with the previous method, MM-FSOD achieves state-of-the-art (SOTA) results.

연구 동기 및 목표

  • 소규모 레이블이 부여된 예시만으로 새로운 객체 종류를 검출하는 문제를 해결하여 대규모 레이블이 부여된 데이터셋에 대한 의존도를 줄이기 위해.
  • 기존 소수 샘플 객체 검출 방법의 한계를 극복하기 위해, 특정 클래스에 맞춰진 적응 기반 또는 코사인 유사도와 같은 최적화되지 않은 거리 측정 기반의 방법에 의존하는 것.
  • 미세튜닝 없이도 새로운 종류의 객체에 일반화 가능한 클래스에 종속되지 않는 검출 프레임워크를 개발하기 위해.
  • 딥 랭스 공간 내에서 특징의 분류 간 간격을 증대하고 내부 클래스 변동성을 감소시켜 특징의 분류 능력을 향상시키기 위해.

제안 방법

  • 메타학습을 통해 내부 클래스 평균 프로토타입을 사용해 저수준 특징을 재구성하는 메타표현(MR) 모듈을 제안하여 새로운 클래스에 대한 빠른 적응을 가능하게 한다.
  • 피어슨 상관계수를 사용해 지원 프로토타입과 쿼리 RoI 간의 유사도를 계산하는 피어슨 거리 기반 모듈(PR)을 도입하여, 코사인 거리에 비해 특징의 결합성과 배경 변동성에 더 강건한 유사도 측정을 가능하게 한다.
  • 모델에 종속되지 않는 메타학습(MAML)에 영감을 얻어 에피소드 기반 학습 프레임워크를 사용하여 MR 모듈을 학습함으로써 새로운 종류의 객체에 대해 신속한 수렴을 달성한다.
  • 최종 분류 레이어를 거리 기반의 유사도 함수로 대체하여, 특징 임bedding의 분류 능력을 최적화하는 엔드 투 엔드 학습을 가능하게 한다.
  • MR 모듈이 지원 세트 프로토타입을 기반으로 쿼리 RoI 특징을 예측하는 특징 재구성 목적을 도입하여, 특징 표현의 품질을 향상시킨다.
  • 빠른 적응을 위한 메타학습과 분류 능력을 향상시키기 위한 거리 측정 학습을 융합하여, 소수 샘플 객체 검출을 위한 통합된 프레임워크를 구축한다.

실험 결과

연구 질문

  • RQ1메타학습을 분류에서 특징 재구성으로 효과적으로 재사용할 수 있는가? 이는 소수 샘플 객체 검출의 성능 향상에 기여하는가?
  • RQ2복잡한 배경 조건 하에서 소수 샘플 객체 검출에서 피어슨 거리와 코사인 거리 간의 특징 유사도 측정 방식은 어떻게 비교되는가?
  • RQ3클래스에 종속되지 않는 검출 모델이 미세튜닝 없이도 새로운 종류의 객체에서 높은 성능을 달성할 수 있는가?
  • RQ4내부 클래스 프로토타입을 통한 특징 재구성은 소수 샘플 검출에서 일반화 능력 향상과 분류 간 간격 증대에 얼마나 기여하는가?

주요 결과

  • MM-FSOD는 소수 샘플 설정 하에서 FSOD, MS COCO, PASCAL VOC 데이터셋에서 최고 성능을 기록하며, 새로운 종류의 객체에 대한 강력한 일반화 능력을 입증하였다.
  • 피어슨 거리를 코사인 거리 대비 사용했을 때, FSOD 데이터셋에서 AP50가 18% 향상되었고, COCO 데이터셋에서는 16.6% 향상되어, 특징 유사도 측정에서의 우수성을 입증하였다.
  • 메타표현(MR) 모듈은 쿼리 RoI 특징을 성공적으로 재구성하고, 각 내부 클래스 프로토타입 주변으로 클러스터링하여 특징의 분류 능력을 향상시켰다.
  • 절단 실험 결과, MR 모듈과 PR 모듈 모두 필수적이며, 두 모듈의 조합이 가장 높은 성능 향상을 이끌었다.
  • 시각화 결과는 MM-FSOD가 복잡한 배경에서도 새로운 종류의 객체를 정확히 검출하며, 대부분의 경우 거짓 경고나 누락 검출이 최소화됨을 보여주었다.
  • 모델는 미세튜닝 없이도 새로운 종류의 객체에 대해 신속한 수렴을 달성하여, 객체 검출에서 제로샷 일반화의 효과성을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.