[논문 리뷰] EfficientCLIP: Efficient Cross-Modal Pre-training by Ensemble Confident Learning and Language Modeling
이 논문은 효율적인 크로스모달 프리트레인을 위한 EfficientCLIP을 제안한다. 이는 노이즈가 있는 데이터를 걸러내기 위해 앙상블 컨피던트 러닝(ECL)을 사용하고, 비페어링 텍스트 데이터에서 자기지도 학습 언어 모델링을 통해 일반화 능력을 향상시킨다. CLIP 및 WenLan가 사용한 자원의 1/10만으로도 중국어 크로스모달 검색에서 최신 기술 수준(SOTA) 성능을 달성하면서 동시에 단일모달 NLP 작업에서도 뛰어난 성능을 발휘한다.
While large scale pre-training has achieved great achievements in bridging the gap between vision and language, it still faces several challenges. First, the cost for pre-training is expensive. Second, there is no efficient way to handle the data noise which degrades model performance. Third, previous methods only leverage limited image-text paired data, while ignoring richer single-modal data, which may result in poor generalization to single-modal downstream tasks. In this work, we propose an EfficientCLIP method via Ensemble Confident Learning to obtain a less noisy data subset. Extra rich non-paired single-modal text data is used for boosting the generalization of text branch. We achieve the state-of-the-art performance on Chinese cross-modal retrieval tasks with only 1/10 training resources compared to CLIP and WenLan, while showing excellent generalization to single-modal tasks, including text retrieval and text classification.
연구 동기 및 목표
- 대규모 크로스모달 프리트레인의 높은 계산 비용을 줄이기 위해.
- 성능 저하를 초래하는 웹 기반 약한 감독 데이터의 노이즈 문제를 해결하기 위해.
- 다양한 비페어링 텍스트 데이터를 활용해 단일모달 NLP 작업으로의 일반화 능력을 향상시키기 위해.
- CLIP 및 WenLan가 사용한 자원의 1/10로도 크로스모달 검색에서 최신 기술 수준 성능을 달성하기 위해.
- 중국어 응용을 위한 강력하고 효율적이며 일반적인 크로스모달 모델을 개발하기 위해.
제안 방법
- 다양한 훈련 에포크에서 훈련된 모델을 앙상블하여 반복적으로 노이즈가 있는 이미지-텍스트 페어를 식별하고 제거하기 위해 앙상블 컨피던트 러닝(ECL)을 사용한다.
- 다른 훈련 단계에서 생성된 여러 샤로우 모델의 예측을 활용해 데이터 신뢰도를 추정하고 노이즈 탐지 능력을 향상시킨다.
- 대규모 비페어링 단일모달 텍스트 데이터를 활용해 대비 학습(SimCSE 스타일) 및 마스킹 언어 모델링을 통한 텍스트 인코더의 자기지도 프리트레인을 수행한다.
- 강력한 시각적 표현을 확보하기 위해 CLIP의 ViT-B/32를 이미지 인코더의 초기화로 사용하여 훈련 비용을 절감하고 수렴 속도를 향상시킨다.
- 데이터 딜리게이션과 MMAP 기반 메모리 매핑을 적용해 데이터 로딩 속도를 향상시키고 GPU 메모리 사용량을 줄인다.
- 모델을 제로샷 설정에서 훈련하고, 텍스트 분류 작업에 대해서만 파인튜닝을 수행한다.
실험 결과
연구 질문
- RQ1완전한 감독 레이블이 없이도 앙상블 컨피던트 러닝이 크로스모달 프리트레인에서 데이터 노이즈를 효과적으로 줄일 수 있는가?
- RQ2비페어링 단일모달 텍스트 데이터가 다운스트림 NLP 작업에서 크로스모달 모델의 일반화 능력을 크게 향상시킬 수 있는가?
- RQ3CLIP 및 WenLan가 사용한 자원의 1/10로도 크로스모달 모델이 중국어 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?
- RQ4자기지도 언어 모델링 통합이 크로스모달 및 단일모달 성능을 모두 향상시키는가?
- RQ5다른 훈련 에포크에서 생성된 다수의 샤로우 모델을 사용하면 데이터 필터링 및 모델 수렴이 어떻게 향상되는가?
주요 결과
- EfficientCLIP는 AIC-ICC 중국어 크로스모달 검색 벤치마크에서 R@1 18.02%를 기록했으며, CLIP보다 4.39% 높고 WenLan보다 3.6% 높다. 훈련 자원은 CLIP 및 WenLan의 1/10 뿐이다.
- COCO 텍스트-이미지 검색 작업에서 EfficientCLIP는 R@1 40.40%를 달성했으며, CLIP의 38.34%를 초월했다.
- 텍스트 검색 작업(LCQMC)에서 EfficientCLIP는 R@10 98.88%를 기록했고, CLIP(96.18%)와 SimCSE(97.32%)를 모두 뛰어넘었다.
- 텍스트 분류 작업(AFQMC)에서 EfficientCLIP는 정확도 81.58%를 달성했으며, CLIP(74.53%)와 SimCSE(78.56%)를 모두 능가했다.
- 앙성 점수 기반 샤로우 모델을 사용함으로써 텍스트 검색 성능이 R@1 42.04%에서 43.48%로 향상되어, 모델 앙상블이 노이즈 필터링에 효과적임을 입증했다.
- SimCSE 기반 프리트레인에 24 GPU일, EfficientCLIP에 240 GPU일(=CLIP 및 WenLan의 1/10)을 훈련한 결과, 효율성 향상이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.