[논문 리뷰] ERNIE-ViL 2.0: Multi-view Contrastive Learning for Image-Text Pre-training
ERNIE-ViL 2.0은 다양한 시각적 시야 간의 내모odal 및 상호모odal 상관관계를 모델링함으로써 이미지-텍스트 사전학습을 위한 다중 시각 대비 학습 프레임워크를 제안한다. 이는 교차 모odal 표현을 향상시킨다. 객체 태그를 특수 텍스트 시각으로 도입하고 이중 인코더 아키텍처를 활용함으로써, 공개된 데이터만을 사용하여도 중국어 교차 모달 검색에서 최고 성능을 달성하고 영어 벤치마크에서도 경쟁력 있는 결과를 얻는다.
Recent Vision-Language Pre-trained (VLP) models based on dual encoder have attracted extensive attention from academia and industry due to their superior performance on various cross-modal tasks and high computational efficiency. They attempt to learn cross-modal representation using contrastive learning on image-text pairs, however, the built inter-modal correlations only rely on a single view for each modality. Actually, an image or a text contains various potential views, just as humans could capture a real-world scene via diverse descriptions or photos. In this paper, we propose ERNIE-ViL 2.0, a Multi-View Contrastive learning framework to build intra-modal and inter-modal correlations between diverse views simultaneously, aiming at learning a more robust cross-modal representation. Specifically, we construct multiple views within each modality to learn the intra-modal correlation for enhancing the single-modal representation. Besides the inherent visual/textual views, we construct sequences of object tags as a special textual view to narrow the cross-modal semantic gap on noisy image-text pairs. Pre-trained with 29M publicly available datasets, ERNIE-ViL 2.0 achieves competitive results on English cross-modal retrieval. Additionally, to generalize our method to Chinese cross-modal tasks, we train ERNIE-ViL 2.0 through scaling up the pre-training datasets to 1.5B Chinese image-text pairs, resulting in significant improvements compared to previous SOTA results on Chinese cross-modal retrieval. We release our pre-trained models in https://github.com/PaddlePaddle/ERNIE.
연구 동기 및 목표
- 이미지-텍스트 사전학습에서 다양한 시각적 시야 간의 내모달 및 상호모달 상관관계를 모델링하여 교차 모달 표현의 강건성과 일반화 능력을 향상시키는 것.
- 노이즈가 있는 웹 크롤링된 이미지-텍스트 쌍에서의 의미 갭을 해소하기 위해 객체 태그를 특수 텍스트 시각으로 도입하여 교차 모달 정렬을 향상시키는 것.
- 공개된 데이터셋만을 사용하여 교차 모달 검색에서 뛰어난 성능을 달성하고 영어 및 중국어 작업에 대해 견고한 벤치마크를 구축하는 것.
- 15억 개의 중국어 이미지-텍스트 쌍으로 모델을 확장하여 중국어 교차 모달 검색에서 최고 성능을 달성하는 것.
제안 방법
- 각 모odal 내에서 이미지-이미지 및 텍스트-텍스트 쌍과 같은 다수의 시각을 구성하여 내모달 상관관계를 학습하고 단일 모달 표현을 향상시킨다.
- 객체 태그의 순서를 특수 텍스트 시각으로 도입하여 세밀한 시각적 개념과 텍스트 기술 간의 다리를 놓고, 교차 모달 의미 갭을 좁힌다.
- 다양한 시각 쌍에 대해 대비 학습을 수행하는 이중 인코더 아키텍처를 활용하며, 상호모달((태그, 이미지), (텍스트, 이미지)) 및 내모달(이미지-이미지, 텍스트-텍스트) 쌍을 포함하여 교차 모달 정렬을 공동 최적화한다.
- 모든 시각 쌍 간의 표현을 공동 최적화하는 다중 시각 대비 학습 목표를 사용하여 강건성과 일반화 능력을 향상시킨다.
- 2900만 개의 공개된 영어 이미지-텍스트 쌍으로 모델을 사전학습하고, 중국어 데이터를 15억 개로 확장하여 제로샷 및 피처샷 일반화 능력을 향상시킨다.
- 교차 모달 매칭을 위해 코사인 유사도를 사용하고, 여러 시각 조합에 대해 대비 손실을 적용하여 시각 불변 표현을 장려한다.
실험 결과
연구 질문
- RQ1다양한 시각 간의 내모달 및 상호모달 상관관계를 모델링함으로써 이미지-텍스트 사전학습에서 교차 모달 표현의 강건성과 일반화 능력이 향상되는가?
- RQ2노이즈가 있는 이미지-텍스트 쌍 간의 의미 갭을 줄이기 위해 객체 태그를 특수 텍스트 시각으로 사용하는 것이 얼마나 효과적인가?
- RQ3공개된 데이터셋만을 사용하여 다중 시각 대비 학습 프레임워크가 교차 모달 검색에서 최고 성능을 달성할 수 있는가?
- RQ415억 개의 중국어 이미지-텍스트 쌍으로 사전학습 데이터를 확장하면 중국어 교차 모달 검색 작업에서 성능 향상이著명하게 이루어지는가?
주요 결과
- ERNIE-ViL 2.0은 단일 시각 대비 학습 기반 모델 대비 이미지-텍스트 검색에서 평균 Recall 에서 2.3%p 의 절대적 향상을 달성했다.
- 텍스트-이미지 검색에서는 3.2%p 의 절대적 향상을 기록하여 더 도전적인 텍스트-이미지 작업에서 뛰어난 성능을 입증했다.
- 객체 태그 기반의 상호모달 대비 학습을 추가하면 평균 Recall 에서 1.6%p 의 절대적 향상이 이루어져 의미 갭 해소에 효과적임을 입증했다.
- 15억 개의 이미지-텍스트 쌍으로 사전학습한 후 ERNIE-ViL 2.0은 중국어 교차 모달 검색에서 최고 성능을 기록했으며, 이전 최고 성능 모델들을 크게 능가했다.
- 모델는 강력한 제로샷 일반화 능력을 보였으며, 세밀한, 추상적인, 긴 尾의 텍스트 쿼리로도 이미지를 성공적으로 검색했다.
- 이미지 및 텍스트 검색 결과는 ERNIE-ViL 2.0 이 노이즈가 많은 웹 크롤링 데이터에서도 세밀한 개념과 사례를 효과적으로 학습하고 있음을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.