[논문 리뷰] VeCLIP: Improving CLIP Training via Visual-enriched Captions
VeCLIP은 LLaVA와 두 번째 LLM을 사용하여 시각적 요소를 반영한 문장(veC)을 생성하고, 원본 AltText와 veC를 번갈아가며 혼합 학습 전략을 적용함으로써 CLIP 사전학습을 향상시킨다. 이 방식은 12M 데이터에서 COCO 및 Flickr30k 검색 성능을 각각 20% 이상 향상시키며, 기존 CLIP의 14% 데이터만으로도 정확도를 3% 이상 향상시킨다.
Large-scale web-crawled datasets are fundamental for the success of pre-training vision-language models, such as CLIP. However, the inherent noise and potential irrelevance of web-crawled AltTexts pose challenges in achieving precise image-text alignment. Existing methods utilizing large language models (LLMs) for caption rewriting have shown promise on small, curated datasets like CC3M and CC12M. This study introduces a scalable pipeline for noisy caption rewriting. Unlike recent LLM rewriting techniques, we emphasize the incorporation of visual concepts into captions, termed as Visual-enriched Captions (VeCap). To ensure data diversity, we propose a novel mixed training scheme that optimizes the utilization of AltTexts alongside newly generated VeCap. We showcase the adaptation of this method for training CLIP on large-scale web-crawled datasets, termed VeCLIP. Employing this cost-effective pipeline, we effortlessly scale our dataset up to 300 million samples named VeCap dataset. Our results show significant advantages in image-text alignment and overall model performance. For example, VeCLIP achieves up to +25.2% gain in COCO and Flickr30k retrieval tasks under the 12M setting. For data efficiency, VeCLIP achieves +3% gain while only using 14% of the data employed in the vanilla CLIP and 11% in ALIGN. We also note the VeCap data is complementary with other well curated datasets good for zero-shot classification tasks. When combining VeCap and DFN, our model can achieve strong performance on both of image-text retrieval and zero-shot classification tasks, e.g. 83.1% accuracy@1 on ImageNet zero-shot for a H/14 model. We release the pre-trained models at https://github.com/apple/ml-veclip.
연구 동기 및 목표
- CLIP 사전학습에 사용되는 대규모 웹 크롤링 데이터셋에서 고품질의 시각적으로 기반한 문장의 부족 문제를 해결하기 위해.
- 기존 고품질 애너테이션에 의존하지 않고도 문장에 시각적 개념을 통합하여 이미지-텍스트 정렬을 향상시키기 위해.
- 원본 AltText와 LLM이 생성한 시각적 요소를 반영한 문장(VeC)을 번갈아 사용하여 사전학습 중 데이터 다양성을 증가시키기 위해.
- 저품질 쌍을 걸러내지 않고도 거대하고 노이즈가 많은 웹 크롤링 데이터에서 효율적이고 확장 가능한 비전-언어 모델 사전학습을 가능하게 하기 위해.
- VeCLIP이 기존 CLIP 및 ALIGN보다 훨씬 적은 데이터로도 뛰어난 성능을 달성할 수 있음을 보여주기 위해.
제안 방법
- LLaVA를 사용해 이미지 내 시각적 요소를 탐지하고 구조화된 시각적 기술문을 생성한다.
- 탐지된 시각적 요소와 원본 AltText를 두 번째 LLM에 입력하여 시각적 개념을 통합한 강화된 문장(VeC)을 생성한다.
- 사전학습 중 원본 AltText와 LLM이 생성한 VeC를 번갈아 사용하는 혼합 학습 전략을 구축하여 데이터 다양성을 증가시킨다.
- 노이즈가 있는 AltText를 포함한 모든 이미지-텍스트 쌍을 유지하여 데이터 효율성을 확보하고 필터링으로 인한 데이터 손실을 방지한다.
- 비전 및 텍스트 인코더를 원본 문장과 VeC 수정 문장을 모두 사용하여 대비 손실 목표를 적용하여 학습한다.
- 두 단계의 문장 생성 파이프라인을 사용한다: 첫 번째로 LLaVA를 통한 시각적 기반; 두 번째로 대규모 언어 모델을 통한 자연어 정제로 유창하고 개념이 풍부한 문장을 생성한다.
실험 결과
연구 질문
- RQ1LLM를 통해 문장에 시각적 개념을 통합함으로써 CLIP 사전학습의 이미지-텍스트 정렬을 크게 향상시킬 수 있는가?
- RQ2원본 AltText와 시각적 요소가 반영된 문장(VeC)을 번갈아 사용하는 혼합 학습 전략이 모델의 일반화 능력 향상과 과적합 감소에 기여하는가?
- RQ3VeCLIP은 기존 CLIP 및 ALIGN 대비 성능을 유지하거나 향상시키면서 데이터 요구량을 얼마나 줄일 수 있는가?
- RQ4문장의 품질이 다운스트림 제로샷 이미지 분류 및 검색 성능에 미치는 영향은 어떠한가?
- RQ5VeCLIP 프레임워크는 CC3M 및 CC12M와 같은 잘 정제된 데이터셋에 일반화될 수 있으며, 일관된 성능 향상을 이끌 수 있는가?
주요 결과
- 12M 데이터 설정에서 VeCLIP은 COCO 이미지-텍스트 검색에서 20.1% 향상되고, Flickr30k 검색에서는 21.3% 향상된다.
- ImageNet 제로샷 분류에서 VeCLIP은 기존 CLIP가 요구하는 데이터의 14%만으로도 정확도를 3% 이상 향상시킨다.
- ALIGN에서 사용된 데이터의 11%만으로도 VeCLIP은 ImageNet 제로샷 분류에서 정확도를 3.1% 향상시킨다.
- AltText와 VeC를 번갈아 사용하는 혼합 학습 전략은 오직 VeC만을 사용할 때보다 제로샷 ImageNet 성능을 1.8% 향상시킨다.
- CC3M 데이터셋에서 LLM-VeC는 COCO 이미지-텍스트 검색을 18.16% 향상시키고, ImageNet 제로샷 정확도를 6.14% 향상시킨다.
- VeCLIP은 ViT-L/14를 포함한 모든 백본 크기에서 기존 CLIP를 일관되게 능가하며, 확장성과 아키텍처 독립성을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.