Skip to main content
QUICK REVIEW

[논문 리뷰] PromptDet: Towards Open-vocabulary Detection using Uncurated Images

Chengjian Feng, Yujie Zhong|arXiv (Cornell University)|2022. 03. 30.
Multimodal Machine Learning Applications인용 수 12
한 줄 요약

PromptDet는 수동 애너테이션 없이 새로운 카테고리의 객체를 검출할 수 있도록 하는 확장성 있고 제로샷 열린 어휘 객체 검출 프레임워크를 제안한다. 이는 고정된 CLIP 텍스트 인코더와 지역적 프롬프트 학습을 활용하여 시각적 임베딩과 텍스트 임베딩을 정렬하며, 새로운 카테고리 검출이 가능하게 한다. 0.1M개의 정제되지 않은 웹 이미지와 상당히 감소된 학습 비용으로 상태의 기술(SOTA) 성능을 달성하며, 새로운 LVIS 카테고리에서 21.4 AP를 기록한다.

ABSTRACT

The goal of this work is to establish a scalable pipeline for expanding an object detector towards novel/unseen categories, using zero manual annotations. To achieve that, we make the following four contributions: (i) in pursuit of generalisation, we propose a two-stage open-vocabulary object detector, where the class-agnostic object proposals are classified with a text encoder from pre-trained visual-language model; (ii) To pair the visual latent space (of RPN box proposals) with that of the pre-trained text encoder, we propose the idea of regional prompt learning to align the textual embedding space with regional visual object features; (iii) To scale up the learning procedure towards detecting a wider spectrum of objects, we exploit the available online resource via a novel self-training framework, which allows to train the proposed detector on a large corpus of noisy uncurated web images. Lastly, (iv) to evaluate our proposed detector, termed as PromptDet, we conduct extensive experiments on the challenging LVIS and MS-COCO dataset. PromptDet shows superior performance over existing approaches with fewer additional training images and zero manual annotations whatsoever. Project page with code: https://fcjian.github.io/promptdet.

연구 동기 및 목표

  • 수동 애너테이션이 필요 없이 새로운, 볼 수 없는 카테고리에 대한 열린 어휘 객체 검출을 가능하게 하기 위해.
  • 사전 훈련된 시각-언어 모델의 텍스트 임베딩과 객체 검출기에서 유도된 시각적 표현 간의 분포 격차를 해소하기 위해.
  • 자기 훈련을 통해 노이즈가 많은 정제되지 않은 웹 이미지를 활용하여 더 넓은 객체 카테고리 집합으로 검출을 확장하기 위해.
  • 고해상도 입력, 광범위한 미세조정 또는 지식 distillation의 필요성을 최소화하여 학습 비용을 감소시키기 위해.
  • 최소한의 인간 데이터로 LVIS 및 MS-COCO 벤치마크에서 최상의 성능을 달성하기 위해.

제안 방법

  • 엔드 투 엔드 미세조정 없이 고정된 CLIP 텍스트 인코더를 분류기 생성기로 사용하는 이중 단계 객체 검출기 채택.
  • 지역적 프롬프트 학습(RPL) 도입: 학습 가능한 프롬프트 벡터를 최적화하여 텍스트 임베딩 공간을 RPN 제안에서 유도된 객체 중심의 시각적 특징과 정렬.
  • 업데이트된 프롬프트를 사용해 웹에서 후보 이미지를 반복적으로 검색하고, 훈련을 위한 가짜 레이블을 생성하는 자기 훈련 프레임워크 개발.
  • 정확도가 높은 상위 K개의 RPN 제안(=20)을 사용해 가짜 레이블링을 수행하여 강건성을 향상시키고 노이즈 있는 예측을 방지.
  • 정제되지 않은 이미지에서 생성된 가짜 레이블 데이터를 사용해 시각적 백본과 클래스 무관 RPN 헤드를 훈련시키며, 텍스트 인코더는 고정.
  • 초기에는 고신뢰도 이미지 후보를 사용하고 점차적으로 자기 훈련을 반복함으로써 프롬프트와 검출기를 개선하는 커리큘럼 학습 전략 적용.

실험 결과

연구 질문

  • RQ1미세조정 없이도 고정된 CLIP 텍스트 인코더를 열린 어휘 객체 검출에 효과적으로 적용할 수 있는가?
  • RQ2시각적 특징이 객체 중심이고 텍스트 특징이 이미지에 무관할 때, 시각적 임베딩 공간과 텍스트 임베딩 공간을 어떻게 정렬할 수 있는가?
  • RQ3노이즈가 많은 데이터를 포함한 정제되지 않은 웹 이미지에서 자기 훈련을 통해 제로샷 검출 성능을 크게 향상시킬 수 있는가?
  • RQ4지역적 프롬프트 학습이 객체 검출 맥락에서 표준 프롬프트 튜닝보다 우월한가?
  • RQ5최소한의 훈련 데이터와 계산 비용으로 검출기가 LVIS와 COCO에서 최상의 성능을 달성할 수 있는가?

주요 결과

  • PromptDet는 LVIS v1.0 검증 세트에서 새로운 카테고리에서 21.4 AP를 기록하며, 이는 이전의 SOTA인 ViLD-ens보다 4.8 AP 높고, Detic보다 3.6 AP 높다.
  • 72개의 훈련 에포크와 0.1M개의 정제되지 않은 웹 이미지만으로 PromptDet는 120만 개의 수동 애너테이션 이미지를 사용한 Detic를 능가한다.
  • MS-COCO 열린 어휘 벤치마크(48개 기본, 17개 새로운 카테고리)에서 PromptDet는 새로운 카테고리에서 26.6 AP, 총합 50.6 AP를 기록하며, Detic(각각 24.1 및 44.7 AP)를 능가한다.
  • 상위 20개의 신뢰도 높은 RPN 제안을 사용한 자기 훈련이 가장 높은 성능(새로운 카테고리에서 19.0 AP)을 기록하며, 모든 제안을 사용할 경우 성능은 10.4 AP로 저하된다.
  • CLIP 텍스트 인코더를 고정하고 시각적 백본과 RPN만 미세조정하면 새로운 카테고리 검출에서 1.8 AP 감소가 발생함으로써, 프롬프트 기반 적응의 중요성을 입증한다.
  • 72 에포크로 훈련을 연장하면 일반 카테고리에서 18.5 AP에서 23.3 AP로, 빈도 높은 카테고리에서 25.8 AP에서 29.3 AP로 각각 성능 향상이 이루어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.