[논문 리뷰] EVA-CLIP-18B: Scaling CLIP to 18 Billion Parameters
EVA-CLIP-18B는 180억 파라미터를 가진 대조적 언어-이미지 사전학습 모델로, LAION-2B와 COYO-700M에서 유래한 60억 개의 훈련 샘플만을 사용함에도 불구하고 27개의 이미지 분류 벤치마크에서 최신 기술 수준(SoTA)의 0-샷 정확도 80.7%를 달성한다. 이는 모델 확장을 통해 일관된 성능 향상이 가능함을 보여주며, EVA 스타일의 약한-강한 시각적 스케일링 전략을 활용하여 공개된 가중치를 사용해 이미지, 영상, 3D 표현 학습 분야에서 최신 기술 수준의 성능을 달성한다.
Scaling up contrastive language-image pretraining (CLIP) is critical for empowering both vision and multimodal models. We present EVA-CLIP-18B, the largest and most powerful open-source CLIP model to date, with 18-billion parameters. With only 6-billion training samples seen, EVA-CLIP-18B achieves an exceptional 80.7% zero-shot top-1 accuracy averaged across 27 widely recognized image classification benchmarks, outperforming its forerunner EVA-CLIP (5-billion parameters) and other open-source CLIP models by a large margin. Remarkably, we observe a consistent performance improvement with the model size scaling of EVA-CLIP, despite maintaining a constant training dataset of 2-billion image-text pairs from LAION-2B and COYO-700M. This dataset is openly available and much smaller than the in-house datasets (e.g., DFN-5B, WebLI-10B) employed in other state-of-the-art CLIP models. EVA-CLIP-18B demonstrates the potential of EVA-style weak-to-strong visual model scaling. With our model weights made publicly available, we hope to facilitate future research in vision and multimodal foundation models.
연구 동기 및 목표
- 다양한 비전 벤치마크에서 높은 성능을 유지하면서 CLIP 모델을 사상 최대 규모(180억 파라미터)로 확장하는 것.
- 훈련 데이터 크기를 늘리지 않고도 모델 확장을 통해 일관된 성능 향상이 가능할지 탐구하는 것.
- 대규모 대조적 사전학습에 EVA 스타일의 약한-강한 시각적 스케일링 원리를 효과적으로 적용할 수 있는지 검증하는 것.
- 더 큰 CLIP 모델이 이미지, 영상, 3D 표현 학습 분야에서 뛰어난 0-샷 성능을 달성할 수 있는지 보여주는 것.
- 연구를 가속화하기 위해 강력한 오픈소스 기초 모델을 공개하는 것.
제안 방법
- LAION-2B와 COYO-700M에서 유래한 20억 개의 이미지-텍스트 쌍으로 구성된 정제된 데이터셋에서 대조적 학습 목표를 사용하여 모델을 훈련시켰으며, 내부 데이터는 사용하지 않았다.
- EVA-CLIP-18B는 180억 파라미터를 가진 비전 트랜스포머 백본을 사용하며, 360개의 A100 GPU에서 전역 배치 크기 108,000으로 훈련된다.
- 모델은 별도의 비전 및 텍스트 인코더를 가진 이중 스트림 아키텍처를 사용하며, 이미지와 텍스트 임베딩 간의 정렬을 위해 대조 손실을 통해 공동 최적화된다.
- 수렴성과 효율성을 향상시키기 위해 데이터 증강 및 혼합 정밀도 훈련을 포함한다.
- 27개의 이미지 분류, 4개의 영상 분류, 2개의 검색 벤치마크에서 0-샷 전이 프로토콜을 사용해 모델을 평가한다.
- 해상도 영향을 연구하기 위해 여러 해상도(224×224, 336×336, 448×448)에서 미세조정 및 평가를 수행한다.

실험 결과
연구 질문
- RQ1180억 파라미터로 확장된 CLIP 모델이 고정된 데이터셋 크기(20억 개의 이미지-텍스트 쌍)에서도 다양한 비전 벤치마크에서 일관된 성능 향상을 보일 수 있는가?
- RQ2EVA 스타일의 약한-강한 시각적 스케일링 원리가 대규모 CLIP 모델에 효과적으로 적용되어 최신 기술 수준의 성능을 달성할 수 있는가?
- RQ3EVA-CLIP-18B의 0-샷 이미지, 영상, 3D 분류 성능는 다른 오픈소스 및 전용 CLIP 모델과 비교해 어떻게 다른가?
- RQ4입력 해상도를 높일 경우 EVA-CLIP-18B와 그 작은 버전에서 0-샷 정확도에 어떤 영향을 미치는가?
- RQ5사전학습 단계에서 영상 데이터를 통합하면 0-샷 영상 분류 성능이 향상되는가?
주요 결과
- EVA-CLIP-18B는 27개의 널리 사용되는 이미지 분류 벤치마크 평균에서 사상 최고 수준의 0-샷 상위-1 정확도 80.7%를 달성한다.
- 오직 60억 개의 훈련 샘플만을 사용했음에도 불구하고, EVA-CLIP-18B는 50억 파라미터를 가진 이전 모델과 다른 오픈소스 CLIP 모델을 상당한 격차로 앞서며 성능을 뛰어넘는다.
- 훈련 데이터가 20억 개의 이미지-텍스트 쌍으로 고정되어 있음에도 불구하고, 모델 크기가 커질수록 일관된 성능 향상이 이루어진다.
- ImageNet-1K에서 선형 프로빙을 수행한 결과, EVA-CLIP-18B는 상위-1 정확도 88.9%를 기록하여 InternVL-C를 0.7%포인트 뛰어넘었다.
- 3D 표현 학습에서 EVA-CLIP-18B는 교사 모델로 기능하며, ModelNet40과 ScanObjectNN에서 각각 87.6%와 65.3%의 상위-1 정확도를 달성하여 0-샷 성능을 향상시켰다.
- 사전학습 단계에서 영상 데이터를 통합하면 Kinetics 및 UCF-101 벤치마크에서 1프레임 기반 +0.7, 8프레임 기반 +0.8의 0-샷 영상 분류 성능 향상이 이루어진다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.