Skip to main content
QUICK REVIEW

[논문 리뷰] When Is Multilinguality a Curse? Language Modeling for 250 High- and Low-Resource Languages

Tyler A. Chang, Catherine Arnett|arXiv (Cornell University)|2023. 11. 15.
Topic Modeling인용 수 5
한 줄 요약

이 연구는 252개의 고자원 및 저자원 언어에서 다국어 사전 훈련이 언어 모델링 성능에 미치는 영향을 조사한다. 10,000개 이상의 단국어 및 다국어 모델을 사용하여, 중간 수준의 다국어 데이터는 문법적으로 유사한 언어를 추가할 경우 저자원 언어 성능을 향상시키며, 이는 단국어 데이터의 +33%에 해당하지만, 고자원 언어 성능은 손상되며 이는 단국어 데이터의 85% 이상을 상실한 것과 유사하다. 이는 모델 용량이 제한되어 있어 발생하는 '다국어화의 저주'를 드러낸다.

ABSTRACT

Multilingual language models are widely used to extend NLP systems to low-resource languages. However, concrete evidence for the effects of multilinguality on language modeling performance in individual languages remains scarce. Here, we pre-train over 10,000 monolingual and multilingual language models for over 250 languages, including multiple language families that are under-studied in NLP. We assess how language modeling performance in each language varies as a function of (1) monolingual dataset size, (2) added multilingual dataset size, (3) linguistic similarity of the added languages, and (4) model size (up to 45M parameters). We find that in moderation, adding multilingual data improves low-resource language modeling performance, similar to increasing low-resource dataset sizes by up to 33%. Improvements depend on the syntactic similarity of the added multilingual data, with marginal additional effects of vocabulary overlap. However, high-resource languages consistently perform worse in multilingual pre-training scenarios. As dataset sizes increase, adding multilingual data begins to hurt performance for both low-resource and high-resource languages, likely due to limited model capacity (the "curse of multilinguality"). These results suggest that massively multilingual pre-training may not be optimal for any languages involved, but that more targeted models can significantly improve performance.

연구 동기 및 목표

  • 다양한 언어 가문에 걸쳐 개별 언어에서 다국어 사전 훈련이 언어 모델링 성능에 미치는 영향을 평가하기 위해.
  • 다국어 데이터셋 크기, 언어 유사성(문법적 및 어휘적 유사성), 모델 크기의 영향을 분리하여 성능에 미치는 영향을 분석하기 위해.
  • 다국어 사전 훈련 결과를 단국어 기준선과 비교하여 성능 향상 또는 손실의 정도를 정량화하기 위해.
  • 다국어 데이터 증가에 따라 성능 저하가 발생하는 '다국어화의 저주'가 저자원 및 고자원 언어 모두에 적용되는지 조사하기 위해.
  • 일괄적인 대규모 모델이 아닌, 보다 효과적이고 타겟된 다국어 모델 설계를 위한 실질적인 통찰을 제공하기 위해.

제안 방법

  • 252개 언어에 대해 다양한 단국어 데이터셋 크기를 사용하여 약 1,900개의 단국어 모델을 사전 훈련하여 기준 성능를 확립하기 위해.
  • 다국어 데이터셋 크기, 언어 선택, 모델 크기(최대 45M 파라미터)를 제어하여 약 8,400개의 다국어 모델을 사전 훈련하기 위해.
  • 모든 252개 언어에 동일한 단국어 토크나이저를 사용하여 다국어 모델 간의 퍼즐리티(Perplexity) 비교가 유효하도록 하기 위해.
  • 퍼즐리티를 성능 측정 지표로 사용하고, 다국어 데이터의 영향을 단국어 데이터셋 크기의 등가 변화로 정량화하기 위해.
  • 목표 언어와 추가된 언어 간의 문법적 및 어휘적 유사성 지표를 사용하여 언어 유사성 평가하기 위해.
  • 언어 가문 및 자원 수준에 따라 결과를 분석하여 성능 향상 및 손실의 패턴을 식별하기 위해.

실험 결과

연구 질문

  • RQ1다국어 데이터를 추가하면 저자원 언어의 언어 모델링 성능에 어떤 영향을 미치며, 이는 단국어 데이터 증가의 어느 정도에 해당하는가?
  • RQ2목표 언어와 다국어 데이터 간의 문법적 및 어휘적 유사성이 성능 향상에 어떤 영향을 미치는가?
  • RQ3왜 다국어 사전 훈련은 고자원 언어에서 성능 저하를 지속적으로 유도하는가?
  • RQ4다국어 데이터를 추가할 때, 저자원 및 고자원 언어 모두에서 성능 저하가 시작되는 시점은 언제인가?
  • RQ5어떤 조건에서 다국어 사전 훈련이 개별 언어에 유익하거나 해로운가?

주요 결과

  • 다국어 데이터를 추가하면 저자원 언어의 언어 모델링 성능이 최대 33% 향상되며, 이는 추가된 언어가 문법적으로 유사할 경우 주로 발생한다.
  • 어휘 겹침은 성능 향상에 미미한 영향을 미치며, 이는 다국어 전이에서 문법적 유사성이 주요 요인임을 시사한다.
  • 고자원 언어는 다국어 모델에서 일관되게 성능 저하를 겪으며, 일부 사례에서는 단국어 훈련 데이터의 85% 이상을 상실한 것과 유사한 수준이다.
  • 다국어 데이터셋 크기가 증가함에 따라 저자원 및 고자원 언어 모두에서 성능 저하가 발생하며, 이는 모델 용량이 제한되어 있어 발생하는 '다국어화의 저주'를 시사한다.
  • 다국어 사전 훈련의 이점은 추가된 언어가 문법적으로 유사하고 모델 용량이 충분할 경우에만 저자원 언어에 국한된다.
  • 초대규모 다국어 사전 훈련은 어떤 언어에게도 최적의 방식이 아닐 수 있으며, 더 타겟된 모델 설계가 성능 향상에 크게 기여할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.