[論文レビュー] Cross-Lingual Supervision improves Large Language Models Pre-training
この論文は、エンコーダーデコーダー型の大規模言語モデル(LLMs)の事前学習中に、多言語間の教師あり機械翻訳(MT)の目的関数を統合することで、複数の言語においてオープン生成およびクローズド生成タスクの文脈内学習性能が顕著に向上することを示している。訓練中にMTと自己教師あり言語モデル学習のデータの混合割合を、多腕バンディットを用いた自動カリキュラム学習によって動的に最適化することで、高価なグリッドサーチを回避しつつ、静的データサンプリング戦略や最先端のベースラインを上回る結果が得られた。翻訳および質問応答ベンチマークにおいて優れた性能を発揮した。
The recent rapid progress in pre-training Large Language Models has relied on using self-supervised language modeling objectives like next token prediction or span corruption. On the other hand, Machine Translation Systems are mostly trained using cross-lingual supervision that requires aligned data between source and target languages. We demonstrate that pre-training Large Language Models on a mixture of a self-supervised Language Modeling objective and the supervised Machine Translation objective, therefore including cross-lingual parallel data during pre-training, yields models with better in-context learning abilities. As pre-training is a very resource-intensive process and a grid search on the best mixing ratio between the two objectives is prohibitively expensive, we propose a simple yet effective strategy to learn it during pre-training.
研究の動機と目的
- 大規模言語モデル(LLM)の事前学習中に並列多言語データを統合することで、オープンおよびクローズド生成設定の両方において文脈内学習能力が向上するかどうかを調査すること。
- 自己教師あり言語モデル学習と教師ありMT目的関数の間の最適な混合割合を特定する課題に取り組むこと。この最適化はグリッドサーチによるチューニングが計算的に非現実的であるため、代替手段が求められる。
- ハイパーパramータの探索を回避し、静的サンプリングポリシーを上回る性能を達成する動的で自動化された、事前学習中の並列データ使用戦略の開発と評価を行うこと。
- 多言語MTの教師あり情報による利点が、多言語データの露出増加に起因するのか、それとも整列された並列文の構造的特徴に起因するのかを特定すること。
- 低リソース言語における多言語MTの教師あり情報の影響を評価し、強力なMTおよびLLMベースラインと比較すること。
提案手法
- 自己教師あり言語モデル学習(例:次トークン予測)と教師あり機械翻訳目的関数を用いて、並列単語対を含むモノリンガル文の混合データでエンコーダーデコーダー型LLMを事前学習する。
- 多腕バンディットを用いた自動カリキュラム学習を導入し、各訓練ステップで使用する並列MTデータの最適割合を学習する動的データサンプリング戦略を提案する。
- 1.2Bおよび3.8Bパラメータのモデルを用い、1回の実験あたり256 TPUv4コアを5日間使用して十分な規模の訓練を実施する。
- 評価には文脈内学習を適用し、同じ言語の入出力(クローズド生成)と異言語の入出力(オープン生成)を区別する。
- 標準的な指標(BLEUやTyDi QAおよびXTyDi QAにおけるF1スコア)を用いて、M2M-124、GPT-3、XGLM、微調整済みmT5モデルなどの強力なベースラインと比較する。
- MTデータをLM目的関数と組み合わせた場合と単に非英語データ量を増やした場合の違いを分離するためのアブレーションスタディを実施する。

実験結果
リサーチクエスチョン
- RQ1LLMの事前学習中に多言語MTの教師ありデータを統合することで、多言語機械翻訳および質問応答タスクにおける文脈内学習性能が向上するか?
- RQ2自己教師あり言語モデル学習と教師ありMT目的関数のバランスをとる際、静的データサンプリングポリシーを上回る性能を達成できる動的で自動化されたカリキュラム学習戦略は存在するか?
- RQ3観察された性能向上は、多言語データの露出増加に起因するのか、それとも整列された並列文の構造的特徴に起因するのか?
- RQ4性能向上は、高リソース言語対と低リソース言語対の両方で、特にオープン生成とクローズド生成の設定においてどのように変化するか?
- RQ5多言語MTの教師あり情報による性能向上はモデルサイズに比例して拡大するか?また、最先端のMTおよびLLMモデルと比較してどうなるか?
主な発見
- 自動カリキュラム学習を用いた本手法は、多言語機械翻訳で最先端の性能を達成した。M2M-124や他のベースラインを上回り、3.8Bモデルではオープン生成モードでFr→Enで47.6 BLEU、Sw→Enで40.3 BLEUを記録した。
- クローズド生成設定では、3.8BモデルがEn→Ruで41.2 BLEU、En→Swで35.0 BLEUを達成し、同様のタスクで6.7BのGPT-3や7.5BのXGLMモデルを顕著に上回った。
- 自動カリキュラム学習を用いたモデルは、Kaleら(2021)の静的データサンプリングベースラインを上回った。これは、動的スケジューリングによりハイパーパramータチューニングなしで性能向上が達成可能であることを示している。
- アブレーションスタディの結果、LM目的関数とMTデータを組み合わせた場合、単にモノリンガルデータのみを使用した場合に比べ、TyDi QAおよび翻訳タスクで顕著な性能低下が生じた。これは、単なるデータ量の増加ではなく、並列文の構造的特徴が重要であることを示している。
- マレー語(My)やタミル語(Ta)のような低リソース言語では、十分な訓練データが不足していたため性能が芳しくなかったが、Bg→En、Hi→En、Zh→Enの言語対では他のシステムを上回り、強力なゼロショット一般化能力を示した。
- 結果から、多言語MTの教師あり情報は、単なるデータ拡張を超えて多言語能力を強化しており、特にクロスリンガル一般化が求められるオープン生成設定において顕著であることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。