Skip to main content
QUICK REVIEW

[논문 리뷰] Generalizing Multimodal Pre-training into Multilingual via Language Acquisition

Liang Zhang, Anwen Hu|arXiv (Cornell University)|2022. 05. 29.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 CLIP와 같은 단어장비시각-언어미리학습(VLP) 모델을 최소한의 계산 비용과 높은 확장성으로 다국어 시스템으로 일반화하는 경량 프레임워크인 다국어 획득(MultiLingual Acquisition, MLA)을 제안한다. 두 단계의 훈련 전략인 원본 언어 전이(Native Language Transfer)와 언어 노출(Language Exposure)을 통해 기존 언어 성능이 저하되지 않은 채 효율적이고 확장 가능한 다국어 적응을 가능하게 하며, 상당히 적은 데이터와 자원으로 다국어 이미지-텍스트 및 비디오-텍스트 검색에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

English-based Vision-Language Pre-training (VLP) has achieved great success in various downstream tasks. Some efforts have been taken to generalize this success to non-English languages through Multilingual Vision-Language Pre-training (M-VLP). However, due to the large number of languages, M-VLP models often require huge computing resources and cannot be flexibly extended to new languages. In this work, we propose a extbf{M}ulti extbf{L}ingual extbf{A}cquisition (MLA) framework that can easily generalize a monolingual Vision-Language Pre-training model into multilingual. Specifically, we design a lightweight language acquisition encoder based on state-of-the-art monolingual VLP models. We further propose a two-stage training strategy to optimize the language acquisition encoder, namely the Native Language Transfer stage and the Language Exposure stage. With much less multilingual training data and computing resources, our model achieves state-of-the-art performance on multilingual image-text and video-text retrieval benchmarks.

연구 동기 및 목표

  • 기존 다국어시각-언어미리학습(M-VLP) 모델이 새로운 언어를 추가하기 위해 막대한 데이터와 재학습을 요구하는 높은 계산 비용과 열악한 확장성 문제를 해결하기 위해.
  • 기본 모델을 재학습하지 않고도 단어장비시각-언어미리학습(VLP) 모델을 새로운 언어로 효율적이고 영리하게, 성능 저하 없이 확장할 수 있도록 하기 위해.
  • 기존 언어와 새로운 언어 모두에서 강력한 성능을 유지하는 데이터 효율적인 방법을 개발하여, 특히 자원이 제한된 환경에서도 유의미한 성능을 발휘하기 위해.
  • 인간의 언어 학습 방식을 모방하기 위해, 먼저 새로운 언어를 원본 언어에 맞추고, 이후 다중모odal 데이터에 노출시켜 언어 표현을 정렬하기 위해.
  • 분리된 언어 습득기(언어별 적응 모듈)를 통해 기존 언어의 성능 저하 없이 독립적으로 새로운 언어를 추가할 수 있도록 하기 위해.

제안 방법

  • 기존의 단어장비시각-언어미리학습(VLP) 모델(예: CLIP)에 삽입되는 경량 언어 습득 인코더를 도입하며, 이는 언어 습득기와 비원본 언어 임베딩으로 구성된다.
  • 기존의 단어장비시각-언어미리학습(VLP) 인코더 파라미터를 고정하고, 새로운 언어에 대해서는 오직 언어 습득기와 비원본 언어 임베딩만을 미세조정한다.
  • 두 단계 훈련 전략을 구현한다: (1) 원본 언어 전이(Native Language Transfer, NLT)는 대비 학습을 통해 새로운 언어 토큰을 원본 언어에 정렬하고, (2) 언어 노출(Language Exposure, LE)은 새로운 언어 표현을 시각적 특징과 정렬한다.
  • 두 단계 모두에서 이미지-텍스트 대비 학습 목표를 사용하여 새로운 언어에서의 다중모달 정렬을 최적화한다.
  • 전체 M-VLP 모델이 요구하는 다국어 데이터의 일부분만 사용하여 언어 습득기를 훈련함으로써 자원 소비를 줄인다.
  • 언어별 구성 요소를 분리함으로써 새로운 언어를 재학습 없이 독립적으로 추가할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1최소한의 추가 훈련 데이터와 계산 비용으로 단어장비시각-언어미리학습(VLP) 모델을 다국어로 효과적으로 일반화할 수 있는가?
  • RQ2인간의 언어 습득 방식을 모방한 두 단계 훈련 전략이 기존 언어 성능을 유지하면서 다국어 성능을 향상시키는가?
  • RQ3제안된 프레임워크가 이전에 지원된 언어의 성능 저하 없이 새로운 언어를 지원할 수 있는가?
  • RQ4제한된 이미지-텍스트 쌍이 존재하는 저자원 환경에서 모델의 성능은 어떠한가?
  • RQ5특히 많은 언어로 확장할 때, 기존 M-VLP 접근 방식보다 더 데이터 효율적인가?

주요 결과

  • MLA CLIP는 다국어 이미지-텍스트 검색에서 최신 기술 수준(SOTA) 성능을 달성하며, UC 2나 MURAL과 같은 이전 SOTA 모델보다 훨씬 적은 훈련 데이터와 계산 자원으로도 슈퍼리어한 성능을 보였다.
  • XTD 벤치마크에서 MLA CLIP는 새로운 언어로의 미세조정 후에도 원본 언어 성능을 유지한다(예: 영어에서 평균 AR 75.9%). 반면 UC 2는 심각한 성능 저하를 겪는다.
  • 언어당 3만 개의 이미지-텍스트 쌍만으로 훈련된 MLA는 언어당 300만 개의 쌍으로 사전학습된 UC 2보다도 뛰어난 성능을 보였으며, 이는 뛰어난 데이터 효율성을 입증한다.
  • 한국어에 대해 단지 600개의 텍스트-텍스트 쌍만으로도 MLA CLIP는 78.7%의 검색 정확도를 달성했고, 추가로 이미지-텍스트 쌍을 제공함으로써 성능이 더욱 향상되어 80.1%까지 올라갔다.
  • 제거 실험(ablation study) 결과, 두 단계의 훈련 전략이 모두 필수적임을 확인했다: NLT 단계를 제거하면 평균 10점 이상 성능 저하가 발생하고, LE 단계를 제거하면 다중모달 정렬이 열악해진다.
  • 분리된 언어 습득기 덕분에 기존 기반 모델을 재학습하지 않고도 새로운 언어로의 확장이 원활하게 가능하여, 확장 가능한 다국어 다중모달 시스템을 구축할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.