[論文レビュー] Extrapolating Large Language Models to Non-English by Aligning Languages
本稿では、翻訳データと多言語指令データを用いて言語間の意味的空間を整列させることで、LLaMA-7Bのような大規模言語モデルの非英語能力を向上させる、クロスリンガル指令微調整(CoIT)および多言語指令微調整(MuIT)を提案する。非英語の質問応答タスクでは英語微調整済みAlpaca-7Bに対して平均27.83%の向上を達成し、翻訳タスクでは18.89%の向上を示した。m-LLaMAは強力な多言語指令従従性と中間層における整合された意味的表現を示した。
Existing large language models show disparate capability across different languages, due to the imbalance in the training data. Their performances on English tasks are often stronger than on tasks of other languages. In this paper, we empower pre-trained LLMs on non-English languages by building semantic alignment across languages. We start from targeting individual languages by performing cross-lingual instruction-tuning (CoIT) on LLaMA, i.e. tuning it with translation task data and cross-lingual general task data to obtain cross-lingual models (x-LLaMAs), and formulate underlying scaling laws to investigate the advantages of using scalable translation data. Then we perform multilingual instruction-tuning (MuIT) with mixed resources to build multilingual m-LLaMA. We also illustrate how we leverage the scaling laws to optimize data allocation in a resource-constrained setting. Experiment results on cross-lingual benchmarks XQUAD and MLQA show that x-LLaMAs surpass the English instruction-tuned counterpart (Alpaca) by an average of 27.83% across six non-English languages. Evaluation results on translation dataset Flores-101 show that x-LLaMAs outperform previous LLaMA-based models by an average of 18.89%. Encouragingly, m-LLaMA achieves comparable performance to x-LLaMAs on individual languages and demonstrates the ability to follow multilingual instructions. Further analysis on response content and representation space reveals the alignment of the multilingual semantic space within the middle layers of m-LLaMA.
研究の動機と目的
- 英語とはアルファベット的類似性が低い非英語言語におけるLLM性能の不均衡を是正すること。
- 広範な継続的事前学習を伴わずに、事前学習済みLLMのゼロショットおよびフェイシング非英語能力を向上させること。
- スケーラブルでデータ効率の良い方法を確立し、英語言語モデルの能力を低リソース言語に拡張すること。
- リソース制約下での最適なデータ配分を支援するため、クロスリンガル指令微調整のスケーリング法則を定式化すること。
- 多言語指令微調整が、多言語指令に従い、整合的な多言語応答を生成できるモデルを生み出せることを示すこと。
提案手法
- 翻訳タスクとクロスリンガル汎用タスクの両方でLLaMA-7Bを共同微調整することで、言語別x-LLaMAを構築するクロスリンガル指令微調整(CoIT)を提案する。
- 混合多言語指令データを用いて、複数言語を処理できる1つのm-LLaMAモデルを訓練する多言語指令微調整(MuIT)を実施する。
- データ量とモデル性能に基づくCoITのスケーリング法則を定式化し、リソース制約下での最適なデータ配分を支援する。
- 非線形プログラミングを用いて、固定されたデータ予算下で平均的な多言語性能を最大化するように、言語間のデータ配分を最適化する。
- 表現空間と応答の一貫性を分析し、特にm-LLaMAの中間層において意味的整合性が図られているかを検証する。
- 非英語言語の語彙拡張を避けることで複雑性を低減し、代わりにバイトレベルのトークン化とクロスリンガル整合性に依存する。
実験結果
リサーチクエスチョン
- RQ1翻訳タスクと汎用クロスリンガルタスクの両方で共同微調整を行うことで、LLMの非英語言語における性能が顕著に向上するか?
- RQ2言語別x-LLaMAsの性能は、Alpacaのような英語微調整済みモデルと比較して、非英語ベンチマークでどのように異なるか?
- RQ31つの多言語モデル(m-LLaMA)は、特化したx-LLaMAsと同等の性能を達成しつつ、多言語指令従従を可能にするか?
- RQ4特に中間層において、m-LLaMAの意味的空間はどの程度言語間で整合的になっているか?
- RQ5定式化されたスケーリング法則は、限られたデータ予算下での多言語指令微調整における効率的データ配分を支援できるか?
主な発見
- x-LLaMAsは、XQUADおよびMLQAベンチマークにおいて6つの非英語言語で、Alpaca-7Bよりも平均27.83%の向上を示した。
- x-LLaMAsは、Flores-101翻訳ベンチマークにおいて、先行するLLaMAベースのモデルよりも平均18.89%の向上を達成した。
- m-LLaMAは個別の言語で強力なx-LLaMAsと同等の性能を達成し、多言語指令に従う能力を示した。
- 分析の結果、m-LLaMAの多言語意味的空間は中間層で整合的になることが判明し、効果的なクロスリンガル表現学習が行われていることが示された。
- スケーリング法則に基づく最適化されたデータ配分は、均等な配分よりも顕著に高い多言語性能をもたらし、特に高いデータ予算(例:120万トークン)で顕著であった。
- 比較的スケーリング法則から、並列(翻訳)データを用いる方が、単一言語の継続的事前学習よりも意味的整合性を達成する上ではるかに効率的であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。