Skip to main content
QUICK REVIEW

[논문 리뷰] MURAL: Multimodal, Multitask Retrieval Across Languages

Aashi Jain, Mandy Guo|arXiv (Cornell University)|2021. 09. 10.
Multimodal Machine Learning Applications참고 문헌 43인용 수 13
한 줄 요약

MURAL은 18억 개의 이미지-캡션 쌍과 60억 개의 번역 쌍을 기반으로 대비 학습을 통해 다중모odal(이미지-텍스트) 및 다중언어(텍스트-텍스트) 표현을 동시에 학습하는 이중 인코더 모델을 제안한다. 이 모델은 특히 자원이 부족한 언어에서 상태 최고 수준의 제로샷 및 피니팅된 교차모달 검색 성능을 달성하며, 위키백과 이미지-텍스트 데이터셋에서 여덟 종류의 저자원 언어에 대해 ALIGN보다 평균 8.1% 높은 평균 재현율 향상을 기록한다.

ABSTRACT

Both image-caption pairs and translation pairs provide the means to learn deep representations of and connections between languages. We use both types of pairs in MURAL (MUltimodal, MUltitask Representations Across Languages), a dual encoder that solves two tasks: 1) image-text matching and 2) translation pair matching. By incorporating billions of translation pairs, MURAL extends ALIGN (Jia et al. PMLR'21)--a state-of-the-art dual encoder learned from 1.8 billion noisy image-text pairs. When using the same encoders, MURAL's performance matches or exceeds ALIGN's cross-modal retrieval performance on well-resourced languages across several datasets. More importantly, it considerably improves performance on under-resourced languages, showing that text-text learning can overcome a paucity of image-caption examples for these languages. On the Wikipedia Image-Text dataset, for example, MURAL-base improves zero-shot mean recall by 8.1% on average for eight under-resourced languages and by 6.8% on average when fine-tuning. We additionally show that MURAL's text representations cluster not only with respect to genealogical connections but also based on areal linguistics, such as the Balkan Sprachbund.

연구 동기 및 목표

  • 자원이 부족한 언어의 교차모달 검색 성능을 향상시키기 위해, 이미지-캡션 학습 데이터가 제한된 상황에서의 성능 향상을 목표로 한다.
  • 이미지-캡션 데이터가 부족한 상황에서 거대한 다국어 번역 쌍을 통해 다중모달 표현 학습을 향상시킬 수 있는지 조사한다.
  • 이중 인코더 모델이 이미지-텍스트 및 텍스트-텍스트 쌍 양쪽에서 다중작업 대비 학습을 통해 복잡한 교차 인코더 기반 모델을 능가할 수 있는지 평가한다.
  • 학습된 다국어 표현이 계통적 분류 외에도 지역적 언어 접촉(예: 발칸 언어권)과 같은 언어적 관계를 반영하는지 분석한다.

제안 방법

  • 이미지-텍스트 매칭과 텍스트-텍스트(번역 쌍) 매칭이라는 두 작업에서 대비 학습을 사용해 이중 인코더 모델을 훈련한다.
  • Alt-Text 데이터셋에서 확보한 18억 개의 노이즈가 있는 이미지-캡션 쌍과 Common Crawl 기반 bitext 데이터셋에서 확보한 60억 개의 번역 쌍을 활용한다.
  • 배치 내 음성 샘플링과 대비 손실을 사용해 모odal 간 및 언어 간 이미지 및 텍스트 임베딩을 정렬한다.
  • 제로샷 및 소수의 샘플로 일반화 성능을 향상시키기 위해 위키백과 이미지-텍스트(WIT) 데이터셋에서 모델을 피니팅한다.
  • 효율적인 검색 추론을 위해 근사 최근접 이웃(ANN) 검색을 적용한다.
  • 언어적 관계와 지리적 근접성 기반의 클러스터링 패턴을 분석하기 위해 텍스트 임베딩을 시각화한다.

실험 결과

연구 질문

  • RQ1이미지-캡션 데이터가 제한된 상황에서 거대한 다국어 번역 쌍을 학습 자료로 활용하면 자원이 부족한 언어의 교차모달 검색 성능이 향상되는가?
  • RQ2이미지-텍스트 및 텍스트-텍스트 매칭 양쪽에서 다중작업 훈련을 수행하면 단일작업 모델 대비 제로샷 및 피니팅된 검색 성능이 향상되는가?
  • RQ3MURAL에서 학습된 다국어 표현이 계통적 분류 외에도 발칸 언어권처럼 지역적 언어 접촉과 같은 언어적 관계를 반영하는가?
  • RQ4간단한 이중 인코더 아키텍처가 더 복잡한 교차 인코더 모델을 능가할 수 있는가? 이는 확장성 유지 조건에서 가능할까?
  • RQ5프리트레인 데이터에 고자원 핵심 언어가 포함될 경우 모델 성능이 얼마나 향상되는가?

주요 결과

  • MURAL은 위키백과 이미지-텍스트(WIT) 데이터셋에서 여덟 종류의 저자원 언어에 대해 ALIGN보다 제로샷 평균 재현율을 평균 8.1% 향상시키며, 피니팅 후에는 6.8% 향상되었다.
  • XTD 벤치마크에서 MURAL은 다국어 이미지-텍스트 검색에서 ALIGN 대비 평균 4% 높은 Recall@10 성능을 기록했다.
  • MURAL-large는 Multi30k에서 네 종류의 언어에 대해 M3P보다 평균 47.7% 높은 평균 재현율 향상을 기록했으며, UC2 대비 5.9% 향상되었다.
  • WIT에서 제로샷 검색 성능을 평가했을 때, MURAL-large는 고자원 언어에 대해 강력한 번역-테스트 기반 모델 대비 평균 13.2% 높은 재현율을 기록했고, 저자원 언어에 대해서는 9.6% 향상되었다.
  • MURAL-large는 텍스트→텍스트 및 이미지→이미지 검색에서 CxC 벤치마크에서 최고 성능을 기록했으며, 의미적 이미지 유사도 벤치마크에서도 최고 성능을 내는 모델과 동점이 되었다.
  • 텍스트 임베딩 시각화 결과, 언어들이 계통적 관계 외에도 지리적 근접성에 기반한 언어 접촉 패턴(예: 헝가리어와 체코어의 가까움)에 따라 클러스터링되는 것으로 나타나, 다중모달 학습이 접촉 기반 언어 패턴을 포착할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.