[논문 리뷰] Large-scale Bilingual Language-Image Contrastive Learning
이 논문은 기계 번역 없이 11억 개의 한국어 및 영어 이미지-텍스트 쌍으로 훈련된 대규모 双어 다중모달 모델인 KELIP를 제안한다. MAE 사전학습과 다중 크롭 증강을 통해 KELIP는 양 언어에서 뛰어난 제로샷 성능를 달성하며, 교차 언어적 의미 정렬을 학습하고, 시각적 의미에서의 문화적 차이를 포착하며, 다중모달 특징 유사성 분석을 가능하게 한다.
This paper is a technical report to share our experience and findings building a Korean and English bilingual multimodal model. While many of the multimodal datasets focus on English and multilingual multimodal research uses machine-translated texts, employing such machine-translated texts is limited to describing unique expressions, cultural information, and proper noun in languages other than English. In this work, we collect 1.1 billion image-text pairs (708 million Korean and 476 million English) and train a bilingual multimodal model named KELIP. We introduce simple yet effective training schemes, including MAE pre-training and multi-crop augmentation. Extensive experiments demonstrate that a model trained with such training schemes shows competitive performance in both languages. Moreover, we discuss multimodal-related research questions: 1) strong augmentation-based methods can distract the model from learning proper multimodal relations; 2) training multimodal model without cross-lingual relation can learn the relation via visual semantics; 3) our bilingual KELIP can capture cultural differences of visual semantics for the same meaning of words; 4) a large-scale multimodal model can be used for multimodal feature analogy. We hope that this work will provide helpful experience and findings for future research. We provide an open-source pre-trained KELIP.
연구 동기 및 목표
- 기계 번역 텍스트에서 비롯하는 편향을 피하면서 한국어 및 영어를 위한 고성능 이중어 다중모달 모델을 개발하기 위해.
- 공유된 시각적 표현을 통해 명시적인 교차 언어 사전학습 없이도 교차 언어적 의미 정렬이 어떻게 발생할 수 있는지 조사하기 위해.
- 이중어 다중모달 모델이 같은 의미 개념에 대해 서로 다른 언어에서 문화적으로 구별되는 시각적 표현을 어떻게 포착하는지 탐구하기 위해.
- 대규모 다중모달 모델이 다중모달 특징 유사성 작업에 어떻게 기여할 수 있는지 평가하기 위해.
- 대규모 다국어 시각-언어 모델을 구축하기 위한 실용적인 통찰과 훈련 기법을 공유하기 위해.
제안 방법
- 기계 번역 대신 현지어 텍스트를 사용하여 총 11억 개의 이미지-텍스트 쌍(한국어 7억 8천만 개, 영어 4억 7천 600만 개)을 수집한다.
- 시각적 표현 학습을 향상시키기 위해 마스크된 오토인코더(MAE) 사전학습을 적용한다.
- 강건성과 일반화 능력을 향상시키기 위해 다중 크롭 데이터 증강을 적용한다.
- 공유된 임bedding 공간에서 이미지와 텍스트 임베딩을 정렬하기 위해 대비 학습을 사용한다.
- 일치하는 이미지-텍스트 쌍 간의 거리를 최소화하기 위해 대비 목표를 사용하여 별도의 시각 및 언어 인코더를 훈련한다.
- 문화적 시각적 편향을 분석하기 위해 KELIP 가이드드 디퓨전을 사용해 텍스트에서 이미지 생성을 수행한다.
실험 결과
연구 질문
- RQ1색상 왜곡과 같은 강력한 시각적 증강 기법이 모델이 정확한 시각-텍스트 관계를 학습하는 데 방해가 될 수 있는가?
- RQ2명시적인 교차 언어 사전학습 없이도 공유된 시각적 의미를 기반으로 다중모달 모델이 교차 언어적 의미 관계를 학습할 수 있는가?
- RQ3KELIP와 같은 이중어 모델이 서로 다른 언어에서 동일한 의미 개념에 대해 문화적으로 구별되는 시각적 표현을 포착할 수 있는가?
- RQ4대규모 다중모달 모델이 이미지와 텍스트 특징을 조합하여 검색하는 등의 다중모달 특징 유사성 작업을 수행할 수 있는가?
주요 결과
- 색상 왜곡과 같은 강력한 시각적 증강 기법은 모델이 정확한 시각-텍스트 정렬을 학습하는 능력을 방해할 수 있다.
- 명시적인 교차 언어 목표 없이도 공유된 시각적 표현을 통해 모델이 의미적으로 동일한 문장 간에 높은余弦 유사도를 보이며 유의미한 교차 언어적 의미 관계를 학습함을 확인하였다.
- KELIP는 문화적으로 특화된 시각적 의미를 포착한다. 예를 들어 서양식 아침 식사는 계란과 빵을 강조하는 반면, 한국식 아침 식사는 쌀과 국을 강조한다. 이는 시각 생성에서 문화적 인식을 보여준다.
- 모델는 다중모달 특징 유사성 작업을 성공적으로 수행한다: 가중치 기반 융합을 통해 이미지와 텍스트 특징을 조합하면 통합된 의미 기반으로 정확한 이미지 검색이 가능하다.
- KELIP는 다운스트림 작업에서 한국어 및 영어 모두에서 경쟁적인 제로샷 성능를 달성하여 이중어 일반화 능력이 검증되었다.
- 동일한 의미 프롬프트(예: '유령' 또는 '전통 결혼식')에서 언어에 맞는 시각적 규범을 반영하여 서로 다른 문화적 특성을 가진 이미지를 생성할 수 있다는 점에서, 모델가 언어별로 다른 시각적 관례에 민감하게 반응함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.