[논문 리뷰] MobileCLIP: Fast Image-Text Models through Multi-Modal Reinforced Training
MobileCLIP는 강력한 CLIP 모델과 캡션 모델로부터 유도된 합성 캡션 및 임베딩을 활용해 데이터 컴필리션(Dataset)을 보강하고, 다중 모odal 강화 학습을 통해 저지연, 고정확도 성능을 달성한 효율적이고 모바일 최적화된 이미지-텍스트 모델의 가족을 소개한다. 이 방법은 강력한 ViT-B/16 모델들 및 캡션 모델로부터 유도된 합성 캡션과 임베딩을 데이터 컴필리션 데이터셋에 추가함으로써, 경량 비전 및 텍스트 인코더의 더 빠르고 정확한 학습을 가능하게 하며, 기존 ViT-B/16 모델 대비 최대 2.3배 빠른 추론 속도를 기록한 상태최고 수준의 성능을 달성한다.
Contrastive pretraining of image-text foundation models, such as CLIP, demonstrated excellent zero-shot performance and improved robustness on a wide range of downstream tasks. However, these models utilize large transformer-based encoders with significant memory and latency overhead which pose challenges for deployment on mobile devices. In this work, we introduce MobileCLIP -- a new family of efficient image-text models optimized for runtime performance along with a novel and efficient training approach, namely multi-modal reinforced training. The proposed training approach leverages knowledge transfer from an image captioning model and an ensemble of strong CLIP encoders to improve the accuracy of efficient models. Our approach avoids train-time compute overhead by storing the additional knowledge in a reinforced dataset. MobileCLIP sets a new state-of-the-art latency-accuracy tradeoff for zero-shot classification and retrieval tasks on several datasets. Our MobileCLIP-S2 variant is 2.3$ imes$ faster while more accurate compared to previous best CLIP model based on ViT-B/16. We further demonstrate the effectiveness of our multi-modal reinforced training by training a CLIP model based on ViT-B/16 image backbone and achieving +2.9% average performance improvement on 38 evaluation benchmarks compared to the previous best. Moreover, we show that the proposed approach achieves 10$ imes$-1000$ imes$ improved learning efficiency when compared with non-reinforced CLIP training. Code and models are available at https://github.com/apple/ml-mobileclip .
연구 동기 및 목표
- 낮은 지연과 작은 모델 크기를 갖춘 모바일 배포에 적합한 효율적인 이미지-텍스트 인코더를 설계하기 위해.
- 기본 대비 학습 방식으로 훈련된 소형 모델의 정확도가 낮은 문제를 해결하기 위해 학습 효율성을 향상시키기 위해.
- 성능을 희생시키지 않고도 효율적 모델 개발을 위한 계산 비용과 훈련 시간을 줄이기 위해.
- 복잡한 비전 작업, 예를 들어 속성, 관계, 순서 예측과 같은 조합적 이해 능력 및 모델의 강건성을 향상시키기 위해.
- 구조적 혁신과 데이터 강화를 통해 모바일 우수성 CLIP 모델의 새로운 벤치마크를 설정하기 위해.
제안 방법
- 이 방법은 강력한 ViT-B/16 모델 앙상블에서 유도된 합성 이미지 캡션과 CLIP 임베딩을 추가한 데이터 컴필리션 데이터셋의 강화된 버전인 DataCompDR를 도입한다.
- 다중 모달 강화 학습은 사전 훈련된 이미지 캡션 모델과 여러 CLIP 인코더에서 유도된 지식 정제를 활용하여 학습 효율성을 향상시킨다.
- 훈련 과정은 지식 주입 중 반복적인 계산 오버헤드를 방지하기 위해 강화된 데이터셋을 다중 훈련 반복에 사용한다.
- MobileCLIP 모델은 구조적 재패러미터라이제이션과 컨volutional 토큰 믹싱을 활용한 하이브리드 CNN-Transformer 아키텍처를 사용하여 지연과 모델 크기를 줄인다.
- 강화된 데이터셋의 두 가지 변형이 도입된다: 빠른 프로토타이핑을 위한 DataCompDR-12M과 고정확도 훈련을 위한 DataCompDR-1B.
- 이 방법은 동일한 계산 예산에서 표준 CLIP 훈련 대비 학습 효율성에서 10배에서 1000배 향상된 성능을 달성한다.
실험 결과
연구 질문
- RQ1지식 증강 데이터셋이 소형, 모바일 최적화된 이미지-텍스트 모델의 학습 효율성에 크게 기여할 수 있는가?
- RQ2합성 캡션과 CLIP 임베딩을 활용한 다중 모달 강화 학습이 경량 모델의 정확도 향상과 더 빠른 수렴을 이끌 수 있는가?
- RQ3MobileCLIP가 저지연과 작은 모델 크기를 유지하면서도 제로샷 이미지 분류 및 검색에서 상태최고 수준의 성능을 달성할 수 있는가?
- RQ4ARO와 같은 조합적 이해 벤치마크에서 MobileCLIP의 성능이 ViT-B/16 및 SigLIP-B/16와 같은 강력한 베이스라인과 비교해 어떻게 되는가?
- RQ5데이터 강화가 복잡한 조합적 비전 작업에서의 강건성에 얼마나 기여하는가?
주요 결과
- MobileCLIP-S2는 이전 최고 성능을 기록한 ViT-B/16 기반 CLIP 모델 대비 2.3배 더 빠른 추론 속도와 높은 정확도를 기록한다.
- DataCompDR-1B에서 훈련된 MobileCLIP-B는 이전 최고 성능 ViT-B/16 모델 대비 38개 벤치마크 평균에서 2.9% 높은 성능을 기록한다.
- MobileCLIP-S0는 표준 OpenAI ViT-B/16 CLIP 모델과 동일한 평균 정확도를 유지하면서도 5배 더 빠르고 3배 더 작다.
- ARO 벤치마크에서 MobileCLIP-B는 Visual Genome Relation 및 Attributes 데이터셋에서 SigLIP-B/16 대비 각각 19.5%와 12.4% 높은 정확도를 기록한다.
- Flickr30k-Order에서 MobileCLIP-B는 Recall@1을 SigLIP-B/16 대비 69.7% 향상시키고, COCO-Order에서는 50.3% 향상시켰다.
- DataCompDR-1B에서의 훈련은 단일 8× A100 노드를 사용해 약 1일 만에 61.7%의 제로샷 ImageNet-1000 Top-1 정확도를 달성하며, 이는 10배에서 1000배의 학습 효율성 향상을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.