Skip to main content
QUICK REVIEW

[논문 리뷰] Finetune like you pretrain: Improved finetuning of zero-shot vision models

Sachin Goyal, Ananya Kumar|arXiv (Cornell University)|2022. 12. 01.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

이 논문은 CLIP과 같은 제로샷 비전 모델을 미세조정하기 위해 전처리 기간 동안 사용된 동일한 대비 손실을 미세조정 시에도 사용하는 간단하면서도 매우 효과적인 방법인 Fine-tune Like You Pretrain (FLYP)을 제안한다. 클래스 레이블을 텍스트 프롬프트로 간주하고 이미지 임베딩과 프롬프트 임베딩 간의 대비 손실을 최적화함으로써, FLYP는 16개의 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하며, 소수의 샘플로 학습하는 경우 최대 4.6% 향상되고, OOD 일반화에서는 최대 2.7% 향상된다.

ABSTRACT

Finetuning image-text models such as CLIP achieves state-of-the-art accuracies on a variety of benchmarks. However, recent works like WiseFT (Wortsman et al., 2021) and LP-FT (Kumar et al., 2022) have shown that even subtle differences in the finetuning process can lead to surprisingly large differences in the final performance, both for in-distribution (ID) and out-of-distribution (OOD) data. In this work, we show that a natural and simple approach of mimicking contrastive pretraining consistently outperforms alternative finetuning approaches. Specifically, we cast downstream class labels as text prompts and continue optimizing the contrastive loss between image embeddings and class-descriptive prompt embeddings (contrastive finetuning). Our method consistently outperforms baselines across 7 distribution shifts, 6 transfer learning, and 3 few-shot learning benchmarks. On WILDS-iWILDCam, our proposed approach FLYP outperforms the top of the leaderboard by $2.3\%$ ID and $2.7\%$ OOD, giving the highest reported accuracy. Averaged across 7 OOD datasets (2 WILDS and 5 ImageNet associated shifts), FLYP gives gains of $4.2\%$ OOD over standard finetuning and outperforms the current state of the art (LP-FT) by more than $1\%$ both ID and OOD. Similarly, on 3 few-shot learning benchmarks, our approach gives gains up to $4.6\%$ over standard finetuning and $4.4\%$ over the state of the art. In total, these benchmarks establish contrastive finetuning as a simple, intuitive, and state-of-the-art approach for supervised finetuning of image-text models like CLIP. Code is available at https://github.com/locuslab/FLYP.

연구 동기 및 목표

  • 미세조정된 비전-언어 모델에서 내분포(in-distribution)와 외분포(out-of-distribution) 일반화 간의 성능 격차를 해소하기 위해.
  • 미세조정 목표를 전처리 목표와 일치시킴으로써 정확성과 강건성 향상 여부를 조사하기 위해.
  • 미세조정 시 대비 손실을 사용하는 최소화되고 직관적인 접근 방식이 복잡한 다단계 또는 앙상블 기반 베이스라인을 초월할 수 있는지 평가하기 위해.
  • 대비 미세조정이 효과적이라는 것을 보여줌으로써, 제로샷 비전 모델의 감독 기반 미세조정을 위한 새로운 기준 베이스라인을 설정하기 위해.
  • 제한된 레이블 데이터가 존재하는 소수의 샘플 학습 및 분포 이탈 설정에서 이 방법의 효과성을 탐색하기 위해.

제안 방법

  • 각 클래스 레이블을 자연어 프롬프트로 표현하기 (예: '{class}의 사진'과 같은 방식으로 전처리 프롬프트 스타일을 반복함).
  • 이미지 인코더를 사용해 입력 이미지를 임베딩하고, 텍스트 인코더를 사용해 클래스 기술 프롬프트를 임베딩함.
  • 이미지 임베딩과 해당 프롬프트 임베딩 간의 대비 손실을 최적화하여 전처리 목표를 그대로 반영함.
  • 교차 엔트로피 헤드나 추가 정규화 없이, 오직 대비 손실만을 사용해 엔드 투 엔드 미세조정을 수행함.
  • 표준 최적화 방법(예: AdamW)을 사용해 학습률 스케줄링과 함께 다운스트림 데이터셋에서 모델을 훈련함.
  • 전처리 시 사용된 것과 동일한 손실 함수를 미세조정 시 적용하여 최적화 목표의 일관성을 확보함.
Figure 1 : Finetune Like You Pretrain (FLYP ): Given a downstream classification dataset, standard finetuning approaches revolve around using the cross-entropy loss. In this work, we show that simply using the same loss as the pretraining i.e. contrastive loss, with “task supervision” coming from th
Figure 1 : Finetune Like You Pretrain (FLYP ): Given a downstream classification dataset, standard finetuning approaches revolve around using the cross-entropy loss. In this work, we show that simply using the same loss as the pretraining i.e. contrastive loss, with “task supervision” coming from th

실험 결과

연구 질문

  • RQ1전처리 시 사용된 동일한 대비 손실을 미세조정 시 사용할 경우, 표준 교차 엔트로피 미세조정보다 성능이 향상되는가?
  • RQ2복잡한 다단계 미세조정 방법(LP-FT)이나 앙상블 전략에 비해, 단순하고 통합된 목표(대비 손실)가 성능을 뛰어넘을 수 있는가?
  • RQ3FLYP는 OOD 일반화 벤치마크에서 최신 기술 수준의 방법보다 어떻게 성능을 내는가?
  • RQ4제한된 레이블 데이터가 존재하는 소수의 샘플 학습 시나리오에서 대비 미세조정 접근 방식이 효과적으로 확장되는가?
  • RQ5왜 더 복잡한 베이스라인(정규화 또는 가중치 앙상블 포함)에 비해 단순한 대비 미세조정 접근 방식이 성능이 뛰어나게 되는가?

주요 결과

  • WILDS-iWildCam에서 FLYP는 최상위 랭킹 모델인 ModelSoups(70+ 앙상블 모델)보다 내분포 정확도에서 2.3% 향상되고, 외분포 정확도에서 2.7% 향상되었으며, CLIP ViT-L/14@336px를 사용함.
  • 7개의 OOD 벤치마크(2개의 WILDS 및 5개의 ImageNet shifts)에서 FLYP는 표준 미세조정보다 OOD 정확도가 4.2% 높고, ID 및 OOD 모두에서 LP-FT보다 1% 이상 높은 성능을 기록함.
  • 소수의 샘플 학습에서 FLYP는 표준 미세조정 대비 정확도를 최대 4.6% 향상시키며, 최신 기술 수준(SOTA)인 LP-FT 대비 4.4% 향상되었으며, Rendered-SST2 및 PatchCamelyon 등의 이진 분류 작업에서 성과를 보임.
  • FLYP는 다양한 벤치마크에서 내분포-외분포 전면 곡선을 일관되게 압도하여, 내분포 성능과 강건성 성능 간의 더 나은 트레이드오프를 나타냄.
  • FLYP에 교차 엔트로피 손실을 추가하면 성능이 악화되며, 이는 대비 목표만으로도 충분하고 최적임을 시사함.
  • 이 방법은 단순하고 직관적이며, 아키텍처 수정, 하이퍼파rameter 튜닝, 앙상블 없이도 다양한 설정에서 최신 기술 수준의 성능을 달성함.
(a) OpenAI CLIP ViT-B/16 finetuned on ImageNet
(a) OpenAI CLIP ViT-B/16 finetuned on ImageNet

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.