Skip to main content
QUICK REVIEW

[논문 리뷰] Multilingual Multimodal Pre-training for Zero-Shot Cross-Lingual Transfer of Vision-Language Models

Po-Yao Huang, Mandela Patrick|arXiv (Cornell University)|2021. 03. 16.
Multimodal Machine Learning Applications참고 문헌 68인용 수 5
한 줄 요약

이 논문은 새로운 다국어 비디오 데이터셋인 Multi-HowTo100M를 사용하여 다국어 다모달 사전학습(MMP) 전략을 제안하여 시각-언어 모델에서 제로샷 다국어 간 전이 성능을 향상시킨다. 트랜스포머 기반 모델을 통해 다국어 텍스트와 비디오 데이터를 동시에 사전학습함으로써, 제로샷 설정에서 아홉 개 언어에 걸쳐 평균 R@1에서 2–2.5 점의 절대적 향상이 이루어지며, 다국어 텍스트-비디오 및 텍스트-이미지 검색에서 최신 기술 성능을 달성한다.

ABSTRACT

This paper studies zero-shot cross-lingual transfer of vision-language models. Specifically, we focus on multilingual text-to-video search and propose a Transformer-based model that learns contextualized multilingual multimodal embeddings. Under a zero-shot setting, we empirically demonstrate that performance degrades significantly when we query the multilingual text-video model with non-English sentences. To address this problem, we introduce a multilingual multimodal pre-training strategy, and collect a new multilingual instructional video dataset (MultiHowTo100M) for pre-training. Experiments on VTT show that our method significantly improves video search in non-English languages without additional annotations. Furthermore, when multilingual annotations are available, our method outperforms recent baselines by a large margin in multilingual text-to-video search on VTT and VATEX; as well as in multilingual text-to-image search on Multi30K. Our model and Multi-HowTo100M is available at http://github.com/berniebear/Multi-HT100M.

연구 동기 및 목표

  • 비영어 언어로 쿼리할 경우 시각-언어 모델의 제로샷 다국어 간 전이 능력이 제한됨을 해결한다.
  • 모델이 영어 데이터만으로 사전학습된 경우 비영어 텍스트-비디오 검색에서 성능 저하가 발생하는 문제를 해결한다.
  • 비디오 데이터를 보편적인 의미 기반 기준으로 삼아 다국어 표현을 정렬하는 확장 가능한 다국어 다모달 사전학습 전략을 개발한다.
  • 120만 개의 지침형 비디오를 포함한 아홉 개 언어로 된 다국어 지침 비디오 데이터셋인 Multi-HowTo100M를 구축하여 효과적인 사전학습을 가능하게 한다.
  • 도메인 내 비영어 어노테이션이 없더라도 언어 간 시각-텍스트 정렬이 제로샷 다국어 간 전이의 일반화 능력을 향상시킨다는 것을 입증한다.

제안 방법

  • 쌍체의 텍스트와 비디오 입력에서 다국어 다모달 임베딩을 얻는 트랜스포머 기반의 비디오-텍스트 모델을 제안한다.
  • 다국어 텍스트와 시각적 특징 간의 교차 어텐션을 동시에 최적화하는 다국어 다모달 사전학습(MMP) 목표를 설계한다.
  • HowTo100M 데이터셋에 아홉 개 언어의 자막을 추가하여 총 120만 개의 지침형 비디오를 포함하는 Multi-HowTo100M 데이터셋을 구축한다.
  • 다국어 텍스트와 시각적 표현 간의 정렬을 위해 대비 학습 목표를 사용하여 다국어 비디오-텍스트 데이터로 모델을 사전학습한다.
  • 제로샷 설정에서 영어 어노테이션만을 사용하여 다국어 텍스트-비디오 및 텍스트-이미지 검색 작업에 대해 미세조정한다.
  • 2D-CNN 특징(이미지용)과 3D-CNN 특징(비디오용)을 정렬하기 위해 학습률을 두 배로 조정한 선형 투영 헤드를 적용하여 다중모달 전이를 가능하게 한다.

실험 결과

연구 질문

  • RQ1비록 영어에서 뛰어난 성능을 보이지만, 비영어 언어로 쿼리할 경우 시각-언어 모델이 제로샷 다국어 간 전이에서 성능 저하가 심한 이유는 무엇인가?
  • RQ2비영어 언어의 의미를 공유하는 시각적 데이터를 공통 기반으로 삼아 다국어 텍스트-비디오 데이터로 사전학습하면 제로샷 다국어 간 전이 성능이 향상되는가?
  • RQ3영어 데이터로만 사전학습된 모델에 비해 다국어 다모달 사전학습이 다국어 텍스트-비디오 및 텍스트-이미지 검색 작업에서 성능 향상에 얼마나 기여하는가?
  • RQ4추가 어노테이션이 없이 모odal 간(예: 비디오에서 이미지로) 전이할 경우 제안된 방법의 효과는 어떠한가?
  • RQ5도메인 내 어노테이션이 없는 저자원 언어인 체코어에 대해서도 모델이 일반화 가능한가? 다국어 데이터를 사용하는 베이스라인과 비교해보면 어떻게 되는가?

주요 결과

  • 제안된 다국어 다모달 사전학습(MMP) 전략은 VTT 데이터셋에서 아홉 개 언어에 걸쳐 평균 R@1에서 2–2.5 점의 절대적 향상을 이룩한다.
  • VATEX 데이터셋에서 다국어 어노테이션을 사용할 경우, 최근의 베이스라인을 크게 앞서는 성능을 보이며 다국어 텍스트-비디오 검색에서 뛰어난 성능을 발휘한다.
  • Multi30K에서의 다국어 텍스트-이미지 검색 작업에서 MMP를 적용한 모델은 영어 어노테이션만을 사용함에도 불구하고 MHA-D 및 SMALR와 같은 베이스라인을 초월하여 최신 기술 성능을 달성한다.
  • 영상 모odal에서 이미지 모odal로 전이할 경우, 영어 어노테이션만을 사용하여 Multi30K에서 평균 R@1이 3.2 점 향상되었으며, 저자원 언어인 체코어에서는 더 큰 향상이 이루어졌다.
  • 체코어 어노테이션이 전혀 없더라도 MMP를 적용한 제로샷 모델은 체코어를 포함한 10개 언어를 사용하는 SMALR와 유사한 성능을 달성하여 강력한 제로샷 일반화 능력을 입증한다.
  • 이 방법은 영어 쿼리와 비영어 쿼리 간 성능 격차를 크게 줄이며, 비록 도메인 내 어노테이션이 없더라도 비디오 데이터가 다국어 표현 정렬을 위한 보편적인 기반으로 기능할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.