Skip to main content
QUICK REVIEW

[논문 리뷰] EfficientCLIP: Efficient Cross-Modal Pre-training by Ensemble Confident Learning and Language Modeling

Jue Wang, Haofan Wang|arXiv (Cornell University)|2021. 09. 10.
Multimodal Machine Learning Applications참고 문헌 37인용 수 7
한 줄 요약

이 논문은 효율적인 크로스모달 프리트레인을 위한 EfficientCLIP을 제안한다. 이는 노이즈가 있는 데이터를 걸러내기 위해 앙상블 컨피던트 러닝(ECL)을 사용하고, 비페어링 텍스트 데이터에서 자기지도 학습 언어 모델링을 통해 일반화 능력을 향상시킨다. CLIP 및 WenLan가 사용한 자원의 1/10만으로도 중국어 크로스모달 검색에서 최신 기술 수준(SOTA) 성능을 달성하면서 동시에 단일모달 NLP 작업에서도 뛰어난 성능을 발휘한다.

ABSTRACT

While large scale pre-training has achieved great achievements in bridging the gap between vision and language, it still faces several challenges. First, the cost for pre-training is expensive. Second, there is no efficient way to handle the data noise which degrades model performance. Third, previous methods only leverage limited image-text paired data, while ignoring richer single-modal data, which may result in poor generalization to single-modal downstream tasks. In this work, we propose an EfficientCLIP method via Ensemble Confident Learning to obtain a less noisy data subset. Extra rich non-paired single-modal text data is used for boosting the generalization of text branch. We achieve the state-of-the-art performance on Chinese cross-modal retrieval tasks with only 1/10 training resources compared to CLIP and WenLan, while showing excellent generalization to single-modal tasks, including text retrieval and text classification.

연구 동기 및 목표

  • 대규모 크로스모달 프리트레인의 높은 계산 비용을 줄이기 위해.
  • 성능 저하를 초래하는 웹 기반 약한 감독 데이터의 노이즈 문제를 해결하기 위해.
  • 다양한 비페어링 텍스트 데이터를 활용해 단일모달 NLP 작업으로의 일반화 능력을 향상시키기 위해.
  • CLIP 및 WenLan가 사용한 자원의 1/10로도 크로스모달 검색에서 최신 기술 수준 성능을 달성하기 위해.
  • 중국어 응용을 위한 강력하고 효율적이며 일반적인 크로스모달 모델을 개발하기 위해.

제안 방법

  • 다양한 훈련 에포크에서 훈련된 모델을 앙상블하여 반복적으로 노이즈가 있는 이미지-텍스트 페어를 식별하고 제거하기 위해 앙상블 컨피던트 러닝(ECL)을 사용한다.
  • 다른 훈련 단계에서 생성된 여러 샤로우 모델의 예측을 활용해 데이터 신뢰도를 추정하고 노이즈 탐지 능력을 향상시킨다.
  • 대규모 비페어링 단일모달 텍스트 데이터를 활용해 대비 학습(SimCSE 스타일) 및 마스킹 언어 모델링을 통한 텍스트 인코더의 자기지도 프리트레인을 수행한다.
  • 강력한 시각적 표현을 확보하기 위해 CLIP의 ViT-B/32를 이미지 인코더의 초기화로 사용하여 훈련 비용을 절감하고 수렴 속도를 향상시킨다.
  • 데이터 딜리게이션과 MMAP 기반 메모리 매핑을 적용해 데이터 로딩 속도를 향상시키고 GPU 메모리 사용량을 줄인다.
  • 모델을 제로샷 설정에서 훈련하고, 텍스트 분류 작업에 대해서만 파인튜닝을 수행한다.

실험 결과

연구 질문

  • RQ1완전한 감독 레이블이 없이도 앙상블 컨피던트 러닝이 크로스모달 프리트레인에서 데이터 노이즈를 효과적으로 줄일 수 있는가?
  • RQ2비페어링 단일모달 텍스트 데이터가 다운스트림 NLP 작업에서 크로스모달 모델의 일반화 능력을 크게 향상시킬 수 있는가?
  • RQ3CLIP 및 WenLan가 사용한 자원의 1/10로도 크로스모달 모델이 중국어 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ4자기지도 언어 모델링 통합이 크로스모달 및 단일모달 성능을 모두 향상시키는가?
  • RQ5다른 훈련 에포크에서 생성된 다수의 샤로우 모델을 사용하면 데이터 필터링 및 모델 수렴이 어떻게 향상되는가?

주요 결과

  • EfficientCLIP는 AIC-ICC 중국어 크로스모달 검색 벤치마크에서 R@1 18.02%를 기록했으며, CLIP보다 4.39% 높고 WenLan보다 3.6% 높다. 훈련 자원은 CLIP 및 WenLan의 1/10 뿐이다.
  • COCO 텍스트-이미지 검색 작업에서 EfficientCLIP는 R@1 40.40%를 달성했으며, CLIP의 38.34%를 초월했다.
  • 텍스트 검색 작업(LCQMC)에서 EfficientCLIP는 R@10 98.88%를 기록했고, CLIP(96.18%)와 SimCSE(97.32%)를 모두 뛰어넘었다.
  • 텍스트 분류 작업(AFQMC)에서 EfficientCLIP는 정확도 81.58%를 달성했으며, CLIP(74.53%)와 SimCSE(78.56%)를 모두 능가했다.
  • 앙성 점수 기반 샤로우 모델을 사용함으로써 텍스트 검색 성능이 R@1 42.04%에서 43.48%로 향상되어, 모델 앙상블이 노이즈 필터링에 효과적임을 입증했다.
  • SimCSE 기반 프리트레인에 24 GPU일, EfficientCLIP에 240 GPU일(=CLIP 및 WenLan의 1/10)을 훈련한 결과, 효율성 향상이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.