Skip to main content
QUICK REVIEW

[논문 리뷰] SgVA-CLIP: Semantic-guided Visual Adapting of Vision-Language Models for Few-shot Image Classification

Peng Fang, Xiaoshan Yang|arXiv (Cornell University)|2022. 11. 28.
Domain Adaptation and Few-Shot Learning인용 수 4
한 줄 요약

SgVA-CLIP는 암묵적 지식 정련, 시각 전용 대비 손실, 교차 모odal 대비 손실을 통해 임베딩된 지식을 통한 분류 가능한 시각적 특징을 학습함으로써 CLIP와 같은 시각-언어 모델의 소수 샘플 이미지 분류 성능을 향상시키는 의미 지도 시각 적응 프레임워크를 제안한다. 이는 miniImageNet에서 기준 CLIP 대비 최대 4.88% 향상된 최신 기술 성능을 달성하였으며, ResNet101에서는 1.25% 향상되었다.

ABSTRACT

Although significant progress has been made in few-shot learning, most of existing few-shot image classification methods require supervised pre-training on a large amount of samples of base classes, which limits their generalization ability in real world application. Recently, large-scale Vision-Language Pre-trained models (VLPs) have been gaining increasing attention in few-shot learning because they can provide a new paradigm for transferable visual representation learning with easily available text on the Web. However, the VLPs may neglect detailed visual information that is difficult to describe by language sentences, but important for learning an effective classifier to distinguish different images. To address the above problem, we propose a new framework, named Semantic-guided Visual Adapting (SgVA), which can effectively extend vision-language pre-trained models to produce discriminative adapted visual features by comprehensively using an implicit knowledge distillation, a vision-specific contrastive loss, and a cross-modal contrastive loss. The implicit knowledge distillation is designed to transfer the fine-grained cross-modal knowledge to guide the updating of the vision adapter. State-of-the-art results on 13 datasets demonstrate that the adapted visual features can well complement the cross-modal features to improve few-shot image classification.

연구 동기 및 목표

  • 텍스트로 기술하기 어려운 세밀한 시각적 세부 정보를 간과하는 소수 샘플 학습에서의 시각-언어 사전 학습 모델(VLPs)의 한계를 해결한다.
  • 라벨이 부족한 상황에서 교차 모달 정렬을 넘어서 시각적 표현을 향상시켜 소수 샘플 이미지 분류 성능을 향상시킨다.
  • 시각 인코더를 미세 조정하지 않고도 사전 학습된 VLPs(예: CLIP)를 효과적으로 적응시켜 일반화 능력을 유지하면서도 작업에 특화된 특징을 학습한다.
  • 단모달 시각적 표현 학습과 교차 모달 정렬을 종합적으로 통합하여 분류의 강건성과 정확도를 향상시킨다.

제안 방법

  • 시각 인코더를 동결한 상태에서 작업에 특화된 시각적 특징을 학습하는 시각 어댑터 레이어를 도입한다.
  • 사전 학습된 CLIP에서 어댑터로 세밀한 교차 모달 지식을 전달하기 위해 암묵적 지식 정련을 적용한다.
  • 적응된 시각적 특징의 분류 능력을 향상시키기 위해 시각 전용 대비 손실을 최적화한다.
  • 동시에 이미지와 텍스트 표현 간의 정렬을 유지하기 위해 교차 모달 대비 손실을 최적화한다.
  • 더 나은 제로샷 전이를 위해 텍스트 임베딩 품질을 향상시키기 위해 학습 가능한 프롬프트를 사용한다.
  • 시각 인코더를 동결한 상태에서 어댑터와 학습 가능한 프롬프트를 동시에 훈련하여 파라미터 업데이트를 최소화하면서 성능 향상을 극대화한다.

실험 결과

연구 질문

  • RQ1지식 정련과 대비 학습을 통해 적응된 시각적 표현이 표준 교차 모달 정렬을 초월해 소수 샘플 이미지 분류 성능을 향상시킬 수 있는가?
  • RQ2단모달 시각적 특징 학습과 교차 모달 정렬의 통합이 소수 샘플 벤치마크에서 성능에 어떤 영향을 미치는가?
  • RQ3소수 샘플 정확도를 최대화하기 위해 시각 어댑터의 최적 구성(예: 은닉 차원, 온도)은 무엇인가?
  • RQ4SgVA-CLIP는 다양한 시각 백본과 소수 샘플 설정 간에 일반화되는가?
  • RQ5시각 인코더를 미세 조정하지 않고도 소수의 외부 파라미터에 의존하여 성능 향상을 어느 정도 달성할 수 있는가?

주요 결과

  • SgVA-CLIP는 5-way 1-shot 설정에서 miniImageNet에서 97.95%의 정확도를 달성하여 CLIP 기준선 대비 4.88% 향상되었다.
  • tieredImageNet에서는 5-way 1-shot 설정에서 95.73%의 정확도를 기록하여 기준선 대비 6.01%포인트 향상되었다.
  • 시각 어댑터와 학습 가능한 프롬프트의 조합이 가장 높은 성능을 보였으며, ViT-B/16에서 CoOp 대비 평균 2.74%의 정확도 향상을 기록했다.
  • 지식 정련에 최적의 온도 하이퍼파라미터는 τ₂ = 5이며, 이는 ImageNet과 SUN397에서 최고의 성능을 내는 데 기여했다.
  • 은닉 차원이 4096인 시각 어댑터가 표현 능력과 부여의 균형을 가장 잘 이루며, 더 작은 또는 더 큰 설정보다 뛰어난 성능을 보였다.
  • 시각화 결과는 적응된 시각적 특징이 사전 학습된 특징보다 더 분류 능력이 뛰어나며, 특히 부리가 다름에도 불구하고 외형이 유사한 새 종류를 더 잘 분리함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.