Skip to main content
QUICK REVIEW

[論文レビュー] UniMax: Fairer and more Effective Language Sampling for Large-Scale Multilingual Pretraining

Hyung Won Chung, Noah Constant|arXiv (Cornell University)|Apr 18, 2023
Natural Language Processing Techniques被引用数 6
ひとこと要約

UniMaxは、多言語事前学習のための新しい言語サンプリング戦略であり、各言語の最大繰り返し回数を制限することで、言語間のトレーニングトークンの分配をより公平にする。これにより、低リソース言語における過学習を軽減しながら、高リソース言語の均一なカバレッジを維持する。標準的な温度ベースのサンプリングと比較して、複数のモデルスケールおよびベンチマークで優れた性能を示し、一般化性能が向上し、記憶のリスクが低減される。

ABSTRACT

Pretrained multilingual large language models have typically used heuristic temperature-based sampling to balance between different languages. However previous work has not systematically evaluated the efficacy of different pretraining language distributions across model scales. In this paper, we propose a new sampling method, UniMax, that delivers more uniform coverage of head languages while mitigating overfitting on tail languages by explicitly capping the number of repeats over each language's corpus. We perform an extensive series of ablations testing a range of sampling strategies on a suite of multilingual benchmarks, while varying model scale. We find that UniMax outperforms standard temperature-based sampling, and the benefits persist as scale increases. As part of our contribution, we release: (i) an improved and refreshed mC4 multilingual corpus consisting of 29 trillion characters across 107 languages, and (ii) a suite of pretrained umT5 model checkpoints trained with UniMax sampling.

研究の動機と目的

  • 低リソース言語における極端なデータ不足が引き起こす多言語事前学習の不均衡を是正すること。
  • 標準的な温度ベースのサンプリングにおける低リソース言語データの過剰な繰り返しによる過学習および記憶リスクを軽減すること。
  • 高リソース言語を再優先することなく、均一な言語カバレッジを維持しながら、スケーラブルで計算効率の良いサンプリング戦略を開発すること。
  • さまざまなモデルスケールおよび多言語ベンチマークにおける異なるサンプリング戦略の影響を評価すること。
  • UniMaxを用いてトレーニングされた、改善されたmC4コーパスおよびumT5モデルのリリースを通じて、広範な研究利用を促進すること。

提案手法

  • UniMaxは、最大繰り返し回数(N)に基づいて、言語の代表が不足している言語に事前にトレーニングトークンを割り当て、どの言語もN回を超えてトレーニングエポックを繰り返さないように保証する。
  • 残りのトレーニング予算については、十分なデータがあるすべての言語に均等にトークンを割り当て、言語的有用性を優先し、分布バイアスを最小限に抑える。
  • この手法は、言語ごとのデータ繰り返しを明示的に制御することで、大規模モデルにおける過学習および記憶を直接是正する。
  • 固定された計算予算(例:1024のシーケンス長で100万ステップ)を制約として用い、トレーニングのための固定トークン予算に変換する。
  • モデルスケーリングに対しても頑健であり、モデルサイズが増加してもバランスの取れた言語カバレッジを維持する。
  • ヒューリスティックな温度ハイパーパrameterに依存しないように、繰り返し回数に硬い上限を設けることで、それらを置き換える。

実験結果

リサーチクエスチョン

  • RQ1各言語の繰り返し回数に上限を設けることで、多言語ベンチマークにおける下流タスクのパフォーマンスが向上するか?
  • RQ2さまざまなモデルスケールにおいて、UniMaxは温度ベースのサンプリングと比較して、一般化性能および過学習の観点でどのように異なるか?
  • RQ3言語ごとに均等なトレーニングトークンの分配が、高リソースおよび低リソース言語の両方でより良いパフォーマンスをもたらすか?
  • RQ4UniMaxは、繰り返し使用される低リソース言語の例による記憶リスクをどの程度低減するか?
  • RQ5mC4のような刷新され、より大きな多言語コーパスに適用した場合、この手法はどの程度の性能を示すか?

主な発見

  • UniMaxは、標準的な温度ベースのサンプリング(τ=3.33)を上回り、多言語ベンチマークで優れた性能を示し、モデルスケールにかかわらず改善が持続する。
  • この手法により、低リソース言語の過剰な繰り返しが軽減された。例えば、ヨルーバ語はUniMaxでは100回しか繰り返されず、τ=3.33では100回を超えて繰り返される。
  • 1×のトレーニング予算で、UniMaxは英語と中国語に等しいトレーニングトークンを割り当て、実際のデータサイズに70倍の差があるにもかかわらず、低リソース言語における過学習を防ぐ。
  • 本論文とともにリリースされた改善されたmC4コーパスには、107言語にわたる合計29兆文字が含まれており、刷新され、よりバランスの取れた多言語データセットを反映している。
  • UniMaxでトレーニングされたumT5モデルのチェックポイントは、多言語評価タスクで一貫した向上を示し、特に低リソース言語において顕著な向上が見られる。
  • この手法はモデルスケーリングに対して頑健である:データ繰り返しの明示的制御により、モデルサイズが増加してもUniMaxの利点が維持される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。