Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Modal Few-Shot Object Detection with Meta-Learning-Based Cross-Modal Prompting

Guangxing Han, Long Chen|arXiv (Cornell University)|2022. 04. 16.
Domain Adaptation and Few-Shot Learning인용 수 9
한 줄 요약

이 논문은 피팅 훈련 없이 소수의 시각적 예시와 클래스 의미 정보를 통합하는 메타러닝 기반의 다중모달 소수 샘플 객체 검출(FSOD)을 위한 교차모달 프롬프팅 프레임워크를 제안한다. 지식 정착을 통해 지원 이미지에서 소프트 프롬프트를 생성함으로써, 인간이 제공한 클래스 이름이 없더라도 새로운 클래스에 대해 일반화된 검출기를 학습할 수 있으며, PASCAL VOC 및 MSCOCO 벤치마크에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We study multi-modal few-shot object detection (FSOD) in this paper, using both few-shot visual examples and class semantic information for detection, which are complementary to each other by definition. Most of the previous works on multi-modal FSOD are fine-tuning-based which are inefficient for online applications. Moreover, these methods usually require expertise like class names to extract class semantic embedding, which are hard to get for rare classes. Our approach is motivated by the high-level conceptual similarity of (metric-based) meta-learning and prompt-based learning to learn generalizable few-shot and zero-shot object detection models respectively without fine-tuning. Specifically, we combine the few-shot visual classifier and text classifier learned via meta-learning and prompt-based learning respectively to build the multi-modal classifier and detection models. In addition, to fully exploit the pre-trained language models, we propose meta-learning-based cross-modal prompting to generate soft prompts for novel classes present in few-shot visual examples, which are then used to learn the text classifier. Knowledge distillation is introduced to learn the soft prompt generator without using human prior knowledge of class names, which may not be available for rare classes. Our insight is that the few-shot support images naturally include related context information and semantics of the class. We comprehensively evaluate the proposed multi-modal FSOD models on multiple few-shot object detection benchmarks, achieving promising results.

연구 동기 및 목표

  • 온라인 응용 프로그램에서 피팅 훈련 기반 소수 샘플 객체 검출의 비효율성을 해결하기 위해.
  • 특히 희귀하거나 알려지지 않은 클래스에 대해 인간이 제공한 클래스 이름이 필요 없이 소수 샘플 객체 검출을 가능하게 하기 위해.
  • 시각적 입력과 의미적 입력을 사용해 메트릭 기반 메타러닝과 프롬프트 기반 학습을 통합하여 다중모달 FSOD를 수행하기 위해.
  • 지식 정착을 통해 소수의 시각적 지원 이미지에서 클래스에 종속되지 않는 소프트 교차모달 프롬프트를 생성하기 위해.
  • 추론 시 파라미터 업데이트 없이도 강력한 소수 샘플 일반화 성능를 달성하기 위해.

제안 방법

  • 피팅 훈련 없이 기초 클래스와 새로운 클래스 모두에 일반화되는 소수 시각적 분류기를 학습하기 위해 메타러닝을 활용한다.
  • 사전 훈련된 시각-언어 모델을 사용해 프롬프트 기반 학습을 통해 제로샷 일반화를 위한 텍스트 분류기를 구성한다.
  • 메타러닝 기반의 교차모달 프롬프팅을 도입하여 소수의 시각적 지원 이미지에서 새로운 클래스를 위한 소프트 프롬프트를 생성한다.
  • 인간이 레이블링한 클래스 이름에 의존하지 않고도 소프트 프롬프트 생성기를 훈련하기 위해 지식 정착을 활용한다.
  • 시각 분류기와 텍스트 분류기를 융합하여 다중모달 검출 헤드를 구성하고, 공동 추론을 수행한다.
  • 이중 브랜치 아키텍처를 사용한다: 하나는 메타러닝된 시각적 메트릭 학습을 위한 것이고, 다른 하나는 프롬프트 기반 텍스트 분류를 위한 것이며, 교차모달 정렬을 수행한다.

실험 결과

연구 질문

  • RQ1메타러닝과 프롬프트 기반 학습이 함께 사용되어 피팅 훈련 없이도 소수 샘플 객체 검출이 효과적으로 가능할 수 있는가?
  • RQ2클래스 이름 감시 없이도 소수의 시각적 예시만으로 소프트 교차모달 프롬프트를 생성할 수 있는가?
  • RQ3인간이 제공한 클래스 이름이 없을 경우 지식 정착이 효과적인 소프트 프롬프트 생성을 가능하게 하는가?
  • RQ4제안된 방법이 클래스 이름이 제공되지 않는 희귀하거나 알려지지 않은 클래스로 일반화 가능한가?
  • RQ5제안된 방법은 DeFRCN과 같은 피팅 훈련 기반 최신 기술 수준의 방법과 비교해 소수 샘플 설정에서 어떻게 성능를 발휘하는가?

주요 결과

  • 제안된 방법은 피팅 훈련 없이도 PASCAL VOC 및 MSCOCO 소수 샘플 객체 검출 벤치마크에서 최신 기술 수준의 성능를 달성한다.
  • 도전적인 MSCOCO 1-shot 설정에서, PCB 모듈이 없는 DeFRCN보다 메타러닝 전용 모델이 뛰어난 성능를 보이며 강력한 일반화 능력을 입증한다.
  • MSCOCO 1-shot에서 22.2 mAP, 5-shot에서 18.7 mAP를 기록하며 이전의 다중모달 FSOD 방법들을 능가한다.
  • PCB 모듈을 사용해 제안된 방법과 DeFRCN을 융합하면 모든 샷 수와 메트릭에서 일관된 성능 향상이 이루어진다.
  • 지식 정착 기반의 소프트 프롬프트 생성기는 인간이 제공한 클래스 이름이 없더라도 효과적인 프롬프트 생성을 가능하게 하며, 이는 희귀 클래스에 매우 중요하다.
  • 제거 실험을 통해 교차모달 프롬프팅과 지식 정착이 성능 및 일반화 능력 향상의 핵심 요소임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.