Skip to main content
QUICK REVIEW

[논문 리뷰] CLIPA-v2: Scaling CLIP Training with 81.1% Zero-shot ImageNet Accuracy within a \$10,000 Budget; An Extra \$4,000 Unlocks 81.8% Accuracy

Xianhang Li, Zeyu Wang|arXiv (Cornell University)|2023. 06. 27.
Digital Media Forensic Detection인용 수 4
한 줄 요약

CLIPA-v2는 사전학습 및 미세조정 단계 모두에 적용 가능한 역수 스케일링 법칙을 도입하여 고성능 CLIP 모델의 효율적 훈련을 가능하게 한다. 이 통찰을 바탕으로 저자들은 H/14 모델을 사용해 1만 달러 이내의 예산으로 81.1%의 제로샷 ImageNet 정확도를 달성하였으며, 이는 이전 최고 성능보다 1.0% 높고 훈련 비용은 약 39배 감소하였다. 추가로 4,000달러를 투자함으로써 정확도는 81.8%로 향상되었다.

ABSTRACT

The recent work CLIPA presents an inverse scaling law for CLIP training -- whereby the larger the image/text encoders used, the shorter the sequence length of image/text tokens that can be applied in training. This finding enables us to train high-performance CLIP models with significantly reduced computations. Building upon this work, we hereby present CLIPA-v2 with two key contributions. Technically, we find this inverse scaling law is also applicable in the finetuning stage, enabling further reduction in computational needs. Empirically, we explore CLIPA at scale, extending the experiments up to the H/14 model with ~13B image-text pairs seen during training. Our results are exciting -- by only allocating a budget of \$10,000, our CLIP model achieves an impressive zero-shot ImageNet accuracy of 81.1%, surpassing the prior best CLIP model (from OpenCLIP, 80.1%) by 1.0% and meanwhile reducing the computational cost by ~39X. Moreover, with an additional investment of $4,000, we can further elevate the zero-shot ImageNet accuracy to 81.8%. Our code and models are available at https://github.com/UCSC-VLAA/CLIPA.

연구 동기 및 목표

  • 사전학습 단계에서 관찰된 역수 스케일링 법칙을 미세조정 단계로 확장하여 CLIP 훈련의 계산 비용을 감소시키는 것.
  • H/14 모델까지의 모델 크기 확장, DataComp-1B까지의 대규모 데이터셋, 약 130억 개의 샘플을 처리하는 장기 훈련 스케줄까지의 확장.
  • 제한된 1만 달러 예산 내에서 최신 기술 수준의 제로샷 ImageNet 정확도를 달성하여 고성능 CLIP 모델의 광범위한 접근성을 가능하게 하는 것.
  • 마스킹 전략과 점진적 미세조정이 모델 성능과 효율성에 미치는 영향을 조사하는 것.
  • 제로샷 분류, 검색, 내성성 테스트 벤치마크에서 CLIPA-v2의 성능을 OpenCLIP 및 기타 최신 기술 모델들과 비교하는 것.

제안 방법

  • 역수 스케일링 법칙을 사전학습 및 미세조정 단계 모두에 적용하여 더 큰 모델이 성능 저하 없이 더 적은 입력 토큰 수를 사용할 수 있도록 하는 것.
  • 점진적 미세조정 스케줄에서 첫 5억 1,200만 개 샘플에 대해 $224^2$ 해상도에서 30%의 무작위 마스킹을 적용하고, 마지막 1억 2,800만 개 샘플에 대해 $336^2$ 해상도에서 40% 마스킹을 적용하는 전략.
  • H/14 모델을 LAION-2B 및 DataComp-1B 데이터셋에서 훈련하며, 사전학습 시 $84^2$ 크기의 이미지 토큰을 사용하고, 미세조정 시 $224^2$/$336^2$ 크기의 토큰을 사용하는 것.
  • 역수 스케일링 행동을 활용하여 사전학습 단계에서 시퀀스 길이를 줄이면서도 높은 정확도를 유지함으로써 훈련 효율성을 최적화하는 것.
  • 두 단계로 나누어 미세조정 전략을 구현: 첫 번째 단계는 해상도를 낮추고 마스킹을 적용한 후, 두 번째 단계는 더 높은 해상도와 낮은 학습률을 적용하는 것.
  • JAX 및 PyTorch 모두에서 훈련된 모델을 오픈소스로 제공하여 재현성과 향후 연구를 지원하는 것.

실험 결과

연구 질문

  • RQ1CLIPA 사전학습에서 관찰된 역수 스케일링 법칙을 미세조정 단계로 확장하여 계산 비용을 추가로 감소시킬 수 있는가?
  • RQ2모델 크기(최대 H/14), 데이터(최대 DataComp-1B), 훈련 스케줄(~130억 개 샘플 처리)를 확장할 경우 제로샷 ImageNet 정확도에 어떤 영향을 미치는가?
  • RQ3미세조정 단계에서 마스킹 전략, 해상도, 학습률 스케줄의 최적 조합은 정확도와 효율성을 극대화하기 위해 무엇인가?
  • RQ4CLIPA-v2는 제로샷 정확도, 내성성, 훈련 비용 측면에서 OpenCLIP 및 기타 최신 기술 모델들과 비교해 어떻게 성능을 내는가?
  • RQ5데이터 소스(LAION-2B 대비 DataComp-1B)와 해상도 점진적 변화가 검색 및 분류 성능에 어떤 영향을 미치는가?

주요 결과

  • CLIPA-v2는 H/14 모델을 사용해 1만 달러 이내 예산으로 81.1%의 제로샷 ImageNet 정확도를 달성하였으며, OpenCLIP의 80.1%보다 1.0% 높다.
  • 이전 최고 성능 CLIP 모델인 OpenCLIP G/14에 비해 훈련 비용을 약 39배 감소시켰다.
  • 추가로 4,000달러를 투자함으로써 고해상도 사전학습과 점진적 미세조정을 통해 제로샷 ImageNet 정확도를 81.8%로 향상시켰다.
  • 224^2 및 336^2 해상도와 30%/40% 마스킹 비율을 적용한 점진적 미세조정은 전체 해상도 미세조정 대비 0.2% 정확도 향상과 1.5배의 속도 향상을 가져왔다.
  • 81.8% 정확도를 달성한 H/14 모델은 모든 내성성 벤치마크에서 OpenCLIP의 80.1% G/14 모델를 능가했다: IN-V2 (+2.0%), IN-A (+13.3%), IN-R (+2.2%), ObjectNet (+4.4%), IN-SK (+3.9%).
  • 비록 제로샷 분류 및 내성성에서 뛰어난 성능을 보였지만, OpenCLIP의 G/14 모델는 COCO 및 Flickr30k에서 제로샷 검색 성능에서 여전히 우위를 점하며, 이는 데이터 분포의 차이가 검색 성능에 유리하게 작용함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.