[논문 리뷰] Retrieval-Enhanced Visual Prompt Learning for Few-shot Classification
이 논문은 캐시된 관련 훈련 임bedding를 검색하여 프롬프트 튜닝을 안내하는, 검색 기반 시각적 프롬프트 학습 프레임워크인 RePrompt을 제안한다. 입력, 중간층, 추론 단계에 검색을 통합함으로써 RePrompt는 11개의 비전 데이터셋과 4개의 도메인 일반화 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성한다. 특히 저샷 및 고도메인 갭 상황에서 뛰어난 성능을 보인다.
The Contrastive Language-Image Pretraining (CLIP) model has been widely used in various downstream vision tasks. The few-shot learning paradigm has been widely adopted to augment its capacity for these tasks. However, current paradigms may struggle with fine-grained classification, such as satellite image recognition, due to widening domain gaps. To address this limitation, we propose retrieval-enhanced visual prompt learning (RePrompt), which introduces retrieval mechanisms to cache and reuse the knowledge of downstream tasks. RePrompt constructs a retrieval database from either training examples or external data if available, and uses a retrieval mechanism to enhance multiple stages of a simple prompt learning baseline, thus narrowing the domain gap. During inference, our enhanced model can reference similar samples brought by retrieval to make more accurate predictions. A detailed analysis reveals that retrieval helps to improve the distribution of late features, thus, improving generalization for downstream tasks. Reprompt attains state-of-the-art performance on a wide range of vision datasets, including 11 image datasets, 3 video datasets, 1 multi-view dataset, and 4 domain generalization benchmarks.
연구 동기 및 목표
- 내부 클래스 시각적 변동성이 높을 경우, 특히 소수의 이미지나 도메인 이격이 있는 설정에서 프롬프트 학습의 일반화 능력이 열 劣하는 문제를 해결한다.
- 고정되거나 학습 가능한 프롬프트 템플릿의 한계를 극복하여, CLIP과 같은 동결된 비전-언어 모델을 자원이 제한된 최종 작업에 적응시키는 데 기여한다.
- 프롬프트 학습 중에 유사한 예제를 검색하여 외부 지식을 통합함으로써 제로샷 및 소수의 이미지 성능을 향상시킨다.
- 단지 1~16장의 이미지만 제공되는 경우에도, 검색 기반 지식 융합을 통해 예측되지 않은 도메인에 효과적으로 적응할 수 있도록 한다.
- 입력, 중간층, 출력 단계에 검색을 통합한 종합적인 프레임워크를 설계하며, 엔드 투 엔드 학습 가이던스를 제공한다.
제안 방법
- 소수의 훈련 세트에서 추출한 동결된 이미지 인코더 특징(키)과 해당 레이블 또는 특징(값)을 사용해 검색 데이터베이스를 구축한다.
- 질의 이미지 특징을 기반으로 최대 내적곱 검색(MIPS)을 사용해 가장 유사한 상위-K개의 훈련 샘플을 검색한다.
- 검색된 지식을 시각적 프롬프트 학습 과정에 두 가지 전략으로 통합한다: (1) 이미지 인코더의 여러 층에 검색 강화 시각적 프롬프트를 삽입하고, (2) 분류 로짓을 보정하기 위해 파rametric k-NN 어댑터를 적용한다.
- 검색 결과를 기반으로 하는 사전 분포 기반의 미분 가능한 손실 함수를 적용하여 모델을 엔드 투 엔드로 학습시키며, 검색의 영향력과 모델의 자신감을 균형 있게 조절한다.
- 검색 인코더로 CLIP ViT-B/16 이미지 인코더($e_R$)를 사용하며, 이는 Timm의 ViT-B/16보다 검색 품질에서 뛰어나다.
- 검색 프롬프트 삽입의 깊이(J)와 온도 하이퍼파라미터($\gamma$)를 동적으로 조정하여 검색의 영향력을 제어하고 노이즈를 방지한다.
실험 결과
연구 질문
- RQ1도메인 갭이 증가할 경우, 유사한 훈련 예제를 검색함으로써 소수의 시각적 프롬프트 학습 성능이 향상되는가?
- RQ2프롬프트 학습의 다양한 단계(입력, 중간, 출력)에 검색을 통합할 경우 모델 성능에 어떤 영향을 미치는가?
- RQ3지식 획득과 노이즈 간의 균형을 고려할 때, 검색 강화 프롬프트 삽입에 최적의 깊이와 온도($\gamma$)는 무엇인가?
- RQ4외부 분포 및 미세한 분류 데이터셋에서 검색 기반 프롬프트 학습은 표준 프롬프트 학습보다 더 잘 일반화되는가?
- RQ5내부 클래스 시각적 변동성이 높을 경우, 검색 기반 프롬프트 학습의 효과성에 어떤 영향을 미치는가?
주요 결과
- RePrompt는 FGVC Aircraft, ImageNet, Oxford Pets와 같은 도전적인 벤치마크를 포함한 11개의 소수의 비전 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, Oxford Pets에서 16샷 조건에서 최대 94.58%의 정확도를 기록했다.
- ImageNet에서는 첫 3층에 검색 강화 프롬프트를 삽입한 RePrompt가 기준선 CoOP 및 VLPT를 초월해 74.57%의 정확도를 달성했다.
- 도메인 일반화 벤치마크(ImageNet-Sketch, ImageNet-A, ImageNet-R, ImageNetV2)에서 RePrompt는 뛰어난 강건성과 일반화 능력을 보이며, 예측되지 않은 도메인에서의 효과성을 확인했다.
- 최적의 삽입 깊이(J)는 데이터셋에 따라 다르며, FGVC Aircraft는 5층, ImageNet은 3층, Oxford Pets는 6층으로, 중간 정도의 검색 통합이 가장 효과적임을 시사한다.
- 낮은 $\gamma$ 값(강한 검색 영향력)일수록 성능 향상이 뚜렷하여, 적절히 튜닝된 경우 검색 보강이 항상 유익함을 보여준다.
- CLIP의 ViT-B/16를 검색 인코더($e_R$)로 사용할 경우, 특히 '벨벳 원단'과 같은 어려운 샘플에서 Timm의 지도 학습 ViT-B/16보다 더 좋은 성능을 기록했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.