Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP Itself is a Strong Fine-tuner: Achieving 85.7% and 88.0% Top-1 Accuracy with ViT-B and ViT-L on ImageNet

Xiaoyi Dong, Jianmin Bao|arXiv (Cornell University)|2022. 12. 12.
Domain Adaptation and Few-Shot Learning인용 수 16
한 줄 요약

이 논문은 CLIP가 철저히 최적화된 초매개변수 전략으로 미세조정될 경우 ImageNet-1K에서 최신 기준 성능을 달성함을 보여주며, ViT-Base 및 ViT-Large 백본을 사용할 때 각각 85.7%와 88.0%의 top-1 정확도를 기록한다. 이는 CLIP가 미세조정에 부적합하다는 믿음에 도전하며, 시각 표현 학습의 강력한 베이스라인으로서의 위치를 확립한다.

ABSTRACT

Recent studies have shown that CLIP has achieved remarkable success in performing zero-shot inference while its fine-tuning performance is not satisfactory. In this paper, we identify that fine-tuning performance is significantly impacted by hyper-parameter choices. We examine various key hyper-parameters and empirically evaluate their impact in fine-tuning CLIP for classification tasks through a comprehensive study. We find that the fine-tuning performance of CLIP is substantially underestimated. Equipped with hyper-parameter refinement, we demonstrate CLIP itself is better or at least competitive in fine-tuning compared with large-scale supervised pre-training approaches or latest works that use CLIP as prediction targets in Masked Image Modeling. Specifically, CLIP ViT-Base/16 and CLIP ViT-Large/14 can achieve 85.7%,88.0% finetuning Top-1 accuracy on the ImageNet-1K dataset . These observations challenge the conventional conclusion that CLIP is not suitable for fine-tuning, and motivate us to rethink recently proposed improvements based on CLIP. We will release our code publicly at \url{https://github.com/LightDXY/FT-CLIP}.

연구 동기 및 목표

  • CLIP의 미세조정 성능가 과도한 초매개변수 선택으로 인해 과소평가되고 있는지 조사하기.
  • ImageNet-1K에서 CLIP의 미세조정 정확도를 극대화하는 데 기여하는 종합적인 초매개변수 설정을 규명하고 검증하기.
  • 직접 미세조정된 CLIP 자체를 지도 학습 사전학습 또는 CLIP-디스틸레이션 방법과 경쟁 가능한 강력한 대안으로 설정하기.
  • 미래의 CLIP 기반 시각 모델 연구를 위한 재현 가능하고 고성능의 기준 베이스라인 제공하기.

제안 방법

  • 최적화된 초매개변수를 사용하여 수정된 학습 프로토콜을 적용해 CLIP ViT-Base/16 및 ViT-Large/14를 ImageNet-1K에서 미세조정.
  • 초기 학습률에 대해 계층별 선형 스케일링 전략을 적용하여 하위 계층은 낮은 학습률로 학습.
  • 20개의 웜업 에포크를 포함한 코즈인 학습률 감소 스케줄링을 사용하고, 기본 초기 학습률은 1e-3으로 설정.
  • RandAug (m9, n2, mstd0.5), mixup (0.8), cutmix (1.0), random erase (0.25)를 포함한 강력한 데이터 증강 기법 적용.
  • 정규화 기법으로서 레이블 스무딩(0.1)과 웨이트 디케이(0.05)를 적용.
  • 상대적 위치 인코딩(RPE) 및 레이어 스케일링(LS)과 같은 아키텍처 수정 사항을 평가하여 미미한 성능 향상을 확인함.

실험 결과

연구 질문

  • RQ1초매개변수가 철저히 최적화될 경우 CLIP가 ImageNet-1K에서 최신 기준의 미세조정 성능을 달성할 수 있는가?
  • RQ2어떤 특정 초매개변수 설정이 CLIP의 미세조정 정확도를 크게 향상시키는가?
  • RQ3마스크된 이미지 모델링에서 CLIP를 디스틸레이션 타겟으로 사용하는 방법과 비교해, 직접 미세조정된 CLIP의 성능는 어떠한가?
  • RQ4아키텍처 수정(예: RPE, LS)이 CLIP의 미세조정 성능 향상에 기여하는가?
  • RQ5드롭패스, 레이블 스무딩, 웨이트 디케이와 같은 정규화 기법이 CLIP 미세조정에 미치는 영향은 무엇인가?

주요 결과

  • CLIP ViT-Base/16는 224×224 입력 해상도에서 ImageNet-1K에서 85.7%의 top-1 정확도를 기록했으며, CLIP를 타겟으로 삼는 최신 기준 MIM 방법보다 0.2% 높은 성능을 보였다.
  • 384×384 입력 해상도에서 CLIP ViT-Base는 86.6%의 top-1 정확도를 기록했으며, JFT-300M 또는 JFT-3B에서 사전학습된 모델과 유사한 성능을 보였다.
  • CLIP ViT-Large/14는 224×224 해상도에서 88.0%의 top-1 정확도를 기록했고, 336×336 해상도에서는 88.3%의 정확도를 기록하여 대규모 모델에서 강력한 성능을 입증했다.
  • 계층별 학습률 전략이 성능 향상에 크게 기여했으며, 반의 수의 계층을 고정한 경우 85.6%의 정확도를 기록했다.
  • 레이블 스무딩(0.1)이 필수적이었으며, 이를 제거할 경우 과적합이 발생하고 top-1 정확도가 85.3%로 떨어졌다.
  • 드롭패스 정규화 기법은 미세조정 시 성능 저하를 초래했으며, 이는 사전학습 단계에서 이 기법이 사용되지 않았기 때문일 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.