[논문 리뷰] Scaling Language-Image Pre-training via Masking
이 논문은 빠른 언어-이미지 사전학습(Fast Language-Image Pre-training, FLIP)을 소개한다. FLIP는 사전학습 중 이미지 패치의 50–75%를 무작위로 마스킹함으로써 CLIP 학습을 가속화하여 빠른 수렴과 향상된 정확도를 달성한다. FLIP는 4억 개의 이미지-텍스트 쌍에서 최대 3.7배 빠른 학습을 달성하면서 다양한 후행 작업에서 CLIP 기준 모델를 능가하며, 희소 계산을 통한 효율적인 대비 학습을 통해 속도와 성능 간의 유리한 트레이드오프를 입증한다.
We present Fast Language-Image Pre-training (FLIP), a simple and more efficient method for training CLIP. Our method randomly masks out and removes a large portion of image patches during training. Masking allows us to learn from more image-text pairs given the same wall-clock time and contrast more samples per iteration with similar memory footprint. It leads to a favorable trade-off between accuracy and training time. In our experiments on 400 million image-text pairs, FLIP improves both accuracy and speed over the no-masking baseline. On a large diversity of downstream tasks, FLIP dominantly outperforms the CLIP counterparts trained on the same data. Facilitated by the speedup, we explore the scaling behavior of increasing the model size, data size, or training length, and report encouraging results and comparisons. We hope that our work will foster future research on scaling vision-language learning.
연구 동기 및 목표
- 대규모 시각-언어 사전학습에서의 높은 월클럭 학습 비용, 특히 CLIP 스타일 모델의 경우를 해결하기 위해.
- 모델 정확도를 훼손하지 않으면서 언어-이미지 사전학습을 위한 효율적인 확장 전략을 탐색하기 위해.
- 패치 마스킹을 통해 희소 계산을 활용하여 더 큰 배치 크기와 함께 더 높은 처리량을 달성함으로써 더 빠른 학습을 가능하게 하기 위해.
- 모델 크기, 데이터 크기, 학습 길이의 스케일링이 FLIP 성능에 미치는 영향을 평가하기 위해.
- 마스킹이 표준 CLIP 학습보다 훨씬 더 유리한 속도-정확도 트레이드오프를 가능하게 하는지 입증하기 위해.
제안 방법
- FLIP는 학습 중 이미지 패치의 50–75%를 무작위로 마스킹하여 계산 부담을 줄이면서도 텍스트로부터의 의미적 지시를 유지한다.
- 이 방법은 마스킹된 이미지 패치와 해당 텍스트 기술 간의 대비 학습 목표를 사용하며, CLIP와 유사하다.
- 마스킹 덕분에 메모리 증가가 최소한이면서도 최대 4배까지 더 큰 배치 크기를 가능하게 하여 기울기 안정성과 정확도를 향상시킨다.
- 학습은 LARS 최적화를 사용하고, 코즈인 학습률 감소, 가중치 감소, 계층별 학습률 감소를 적용하여 수렴을 향상시킨다.
- 표준 미세조정 프rotocol을 사용하여 이미지 캡션, VQA, 제로샷 분류 등의 후행 작업에서 종단 간 엔드 투 엔드 미세조정을 수행한다.
- 이미지 캡션 작업을 위해 ViT 인코더 위에 시퀀스-투-시퀀스 트랜스포머 디코더를 학습시키며, 티처 포싱과 크로스 엔트로피 손실을 사용한다.
실험 결과
연구 질문
- RQ1사전학습 중 패치 마스킹이 후행 성능을 저하시키지 않고도 학습 시간을 크게 줄일 수 있는가?
- RQ2마스킹이 대비 언어-이미지 사전학습에서 정확도와 처리량 간의 트레이드오프에 어떤 영향을 미치는가?
- RQ3FLIP 방법을 사용할 경우 모델 크기, 데이터 크기, 학습 길이의 스케일링 법칙은 무엇인가?
- RQ4동일한 데이터로 학습하고 다양한 후행 작업에서 평가했을 때 FLIP가 CLIP 및 그 변종보다 우월한가?
- RQ5계산 비용이 감소함에 따라 마스킹이 대규모 사전학습의 더 효율적인 탐색을 가능하게 하는가?
주요 결과
- 256개의 TPU-v3 코어에서 FLIP는 CLIP 대비 월클럭 학습 시간을 3.7배 빠르게 하였으며, 유사한 정확도를 더 빨리 도달했다.
- 동일한 학습 에포크 수에서 FLIP는 ViT-L/16 기준 제로샷 ImageNet-1K 정확도 86.1%를 달성하여 CLIP의 84.8%를 초월했다.
- 다양한 후행 작업 세트에서 FLIP는 LAION-400M에서 사전학습한 결과가 OpenCLIP 및 재현된 CLIP 기준 모델을 모두 초월했다.
- FLIP를 사용한 데이터 스케일링은 추가 학습 비용 없이 성능 향상을 보이며, 유리한 데이터 스케일링 행동을 나타낸다.
- 모델 스케일링과 데이터 스케일링 모두 정확도 향상에 기여하며, 특히 데이터 스케일링이 성능 향상에 매우 효율적인 길임을 보여준다.
- FLIP는 COCO 및 NoCaps 벤치마크에서 강력한 제로샷 일반화 성능을 보이며 이미지 캡션 및 VQA 작업에 대해 효율적인 미세조정을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.