Skip to main content
QUICK REVIEW

[논문 리뷰] A Primer on Pretrained Multilingual Language Models

Sumanth Doddapaneni, G. Ramesh|arXiv (Cornell University)|2021. 07. 01.
Domain Adaptation and Few-Shot Learning인용 수 43
한 줄 요약

다국어 언어 모델(MLLMs)의 설계, 목표, 데이터, 벤치마크와 단일 언어 모델과의 비교 성능, 향후 방향에 대한 조사.

ABSTRACT

Multilingual Language Models (\MLLMs) such as mBERT, XLM, XLM-R, extit{etc.} have emerged as a viable option for bringing the power of pretraining to a large number of languages. Given their success in zero-shot transfer learning, there has emerged a large body of work in (i) building bigger \MLLMs~covering a large number of languages (ii) creating exhaustive benchmarks covering a wider variety of tasks and languages for evaluating \MLLMs~ (iii) analysing the performance of \MLLMs~on monolingual, zero-shot cross-lingual and bilingual tasks (iv) understanding the universal language patterns (if any) learnt by \MLLMs~ and (v) augmenting the (often) limited capacity of \MLLMs~ to improve their performance on seen or even unseen languages. In this survey, we review the existing literature covering the above broad areas of research pertaining to \MLLMs. Based on our survey, we recommend some promising directions of future research.

연구 동기 및 목표

  • MLLMs가 어떻게 구성되는지와 모델 간 차이가 무엇인지 검토합니다.
  • 사전학습을 위한 단일 언어 및 병렬 데이터 목표를 요약합니다.
  • 다국어 및 작업별로 MLLMs를 평가하는 벤치마크를 조사합니다.
  • MLLMs가 특정 언어와 작업에서 단일 언어 LMs보다 우수한지 논의합니다.
  • 보이지 않는 언어로 확장하는 방법을 강조하고 미래 방향을 권고합니다.

제안 방법

  • 대표적인 MLLMs의 아키텍처와 구성(N, k, d, 매개변수)을 카탈로그합니다.
  • 사전학습 목표를 비교합니다: MLM, CLM, MRTD, TLM, CAMLM, CLMLM, XLCO, HICTL, CLSA 및 관련 방법들.
  • 단일 언어와 병렬 목표 조합 및 데이터 요구사항을 설명합니다.
  • 지수 평활화를 통한 언어 노출 균형을 고려한 사전학습 데이터 선택과 언어 샘플링을 설명합니다.
  • XGLUE, XTREME, XTREME-R 및 XGLUE와 같은 벤치마크를 작업별로 요약합니다.
  • 교차-언어 전이, 이중언어 작업 및 보편적 패턴 가설에 대한 연구 결과를 종합합니다.

실험 결과

연구 질문

  • RQ1다양한 MLLMs가 어떻게 구축되고 서로 어떻게 다른지?
  • RQ2MLLMs를 평가하는 벤치마크는 무엇인가?
  • RQ3주어진 언어에 대해 MLLMs가 단일 언어 LMs보다 나은가?
  • RQ4MLLMs가 제로샷 교차-언어 전이 및 이중언어 작업을 가능하게 하는가?
  • RQ5MLLMs가 보편적인 언어 패턴을 드러내고 이를 새로운 언어로 확장하는 방법은?

주요 결과

  • MLLMs는 아키텍처, 사전학습 데이터, 다루는 언어, 어휘 크기가 다르며, 일반적으로 더 큰 용량의 모델이 벤치마크에서 더 잘 수행하는 경향이 있습니다.
  • 교차-언어 전이 능력은 공유 어휘, 표현 정렬, 데이터 크기 등의 요인에 좌우되며, 어떤 단일 모델도 모든 설정에서 일관되게 단일 언어 LMs보다 우수하다고 말하기 어렵습니다.
  • XGLUE, XTREME, XTREME-R과 같은 벤치마크는 분류, 구조 예측, QA, 검색 작업 전반에서 교차-언어 성능을 평가하는 데 사용됩니다.
  • 제로샷 교차-언어 전이 및 이중언어 작업은 특히 자원이 적은 언어에서 MLLMs의 이점을 보여주지만, 보편적 중간언어 패턴은 아직 확립되지 않았습니다.
  • 보이지 않는 언어로 확장하는 방법은 미세조정, 어댑터 및 기타 확장 방법을 통해 접근할 수 있습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.