Skip to main content
QUICK REVIEW

[論文レビュー] When Is Multilinguality a Curse? Language Modeling for 250 High- and Low-Resource Languages

Tyler A. Chang, Catherine Arnett|arXiv (Cornell University)|Nov 15, 2023
Topic Modeling被引用数 5
ひとこと要約

本研究では、252の高リソースおよび低リソース言語における言語モデル性能に多言語事前学習が与える影響を調査する。10,000を超える単言語および多言語モデルを用いて、中程度の多言語データが、文法的に類似した言語を追加した場合、低リソース言語の性能を向上させ(単語数換算で+33%に相当)、一方で高リソース言語の性能を損なう(単語数換算で85%以上を失ったことに相当)ことが判明した。これは、モデル容量の制限に起因する「多言語化の呪い」を示している。

ABSTRACT

Multilingual language models are widely used to extend NLP systems to low-resource languages. However, concrete evidence for the effects of multilinguality on language modeling performance in individual languages remains scarce. Here, we pre-train over 10,000 monolingual and multilingual language models for over 250 languages, including multiple language families that are under-studied in NLP. We assess how language modeling performance in each language varies as a function of (1) monolingual dataset size, (2) added multilingual dataset size, (3) linguistic similarity of the added languages, and (4) model size (up to 45M parameters). We find that in moderation, adding multilingual data improves low-resource language modeling performance, similar to increasing low-resource dataset sizes by up to 33%. Improvements depend on the syntactic similarity of the added multilingual data, with marginal additional effects of vocabulary overlap. However, high-resource languages consistently perform worse in multilingual pre-training scenarios. As dataset sizes increase, adding multilingual data begins to hurt performance for both low-resource and high-resource languages, likely due to limited model capacity (the "curse of multilinguality"). These results suggest that massively multilingual pre-training may not be optimal for any languages involved, but that more targeted models can significantly improve performance.

研究の動機と目的

  • 多様な言語系統にまたがる個々の言語における多言語事前学習が言語モデル性能に与える影響を評価すること。
  • 多言語データセットのサイズ、言語的類似性(構文的および語彙的類似性)、モデルサイズが性能に与える影響を分離して評価すること。
  • 多言語事前学習の成果を単言語ベースラインと比較し、性能の向上または低下を定量化すること。
  • 「多言語化の呪い」——多言語データの増加に伴い性能が低下する現象——が、低リソースおよび高リソース両方の言語に適用されるかどうかを調査すること。
  • 大規模で一様なアプローチに代わる、より効果的でターゲットに特化した多言語モデルの設計に役立つ実用的知見を提供すること。

提案手法

  • 252言語の単言語モデルを、さまざまな単言語データセットサイズで事前学習し、ベースライン性能を確立する。
  • 多言語データセットサイズ、言語選択、モデルサイズ(最大4500万パラメータ)を制御した状態で、8,400を超える多言語モデルを事前学習する。
  • 252言語すべてに同一の単語トークン化器を適用し、多言語モデル間での perplexity 比較が有効になるようにする。
  • perplexity を性能指標として用い、多言語データの影響を単語数換算での単言語データ量の増加に相当する量として定量化する。
  • ターゲット言語と追加言語との間の構文的および語彙的類似性を、類似度指標を用いて評価する。
  • 言語系統およびリソースレベルごとに結果を分析し、性能向上・低下のパターンを特定する。

実験結果

リサーチクエスチョン

  • RQ1多言語データを追加すると、低リソース言語の言語モデル性能にどのように影響するか。その影響は、単語数換算でどの程度の単言語データ増加に相当するか。
  • RQ2ターゲット言語と多言語データとの間の構文的および語彙的類似性が、性能向上に与える影響は何か。
  • RQ3なぜ多言語事前学習は、高リソース言語において一貫して性能を低下させるのか。
  • RQ4多言語データを追加し始める段階で、低リソースおよび高リソース両方の言語の性能が劣化し始めるのはどの時点か。
  • RQ5どのような条件下で多言語事前学習が個々の言語に対して有益または有害となるか。

主な発見

  • 多言語データを追加すると、低リソース言語の言語モデル性能が最大で単語数換算で+33%の単言語データ増加に相当する向上を示す。これは、追加言語が構文的に類似している場合に顕著である。
  • 語彙の重複は性能向上にほとんど影響しないことが判明し、多言語間転移の主な要因は構文的類似性であることが示された。
  • 高リソース言語では、多言語モデルにおいて一貫して性能劣化が生じ、一部の事例では単語数換算で85%以上の単言語学習データ喪失に相当する。
  • 多言語データセットサイズが増加するにつれて、低リソースおよび高リソース両方の言語で性能が劣化する傾向が見られ、モデル容量の制限に起因する「多言語化の呪い」が確認された。
  • 多言語事前学習の利点は、追加言語が構文的に類似しており、かつモデル容量が十分に確保されている場合に限り、低リソース言語に限定される。
  • 大規模な多言語事前学習は、あらゆる言語にとって最適ではない可能性があり、よりターゲットに特化したモデル設計により、性能を顕著に向上させられる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。