[論文レビュー] Bactrian-X: Multilingual Replicable Instruction-Following Models with Low-Rank Adaptation
Bactrian-X は、翻訳および応答 distillation を用いて構築された 52 語にわたる 340 万件の命令-応答ペアを含む多言語指令従属データセットを紹介する。低ランク微調整(LoRA)を用いて、ベースモデルや既存の指令微調整モデルよりも顕著に高いゼロショット多言語性能を達成する、軽量で即挿入可能なアダプタを訓練した。XCOPA や XWinograd、人的評価を含む多様なベンチマークで、BLOOMZ や Alpaca などのモデルを上回る性能を示した。
Instruction tuning has shown great promise in improving the performance of large language models. However, research on multilingual instruction tuning has been limited due to the scarcity of high-quality instruction-response datasets across different languages. To bridge this gap, we present Bactrian-X, a comprehensive multilingual parallel dataset of 3.4 million instruction-response pairs across 52 languages. Leveraging this dataset, we train a set of adapters using low-rank adaptation (LoRA), which are lightweight components that seamlessly integrate with large language models. These adapters have a substantially lower parameter count than the base model, making them easily replaceable and usable as plug-ins for different languages or language groups. Extensive experiments in various multilingual evaluation settings demonstrate that models derived from LoRA-based training over Bactrian-X outperform both the vanilla models and existing instruction-tuned models. The code and models are publicly available at https://github.com/mbzuai-nlp/bactrian-x
研究の動機と目的
- 指令従属モデルを訓練するための高品質な多言語指令-応答データセットの不足を解消すること。
- 英語に偏らない多言語一般化性能を向上させ、特にリソースが乏しい言語に対しても有効であることを目指すこと。
- 低ランク微調整(LoRA)を用いたパラメータ効率の良い微調整アプローチを開発し、最小限のパラメータで即挿入可能な言語固有の適応を可能にすること。
- 提案された多言語データセットおよびアダプタ技術の有効性を、多様なゼロショット多言語 NLP タスクにおいて評価すること。
- 研究を促進するため、公開可能なモデルおよびコードを提供すること。
提案手法
- Bactrian-X データセットは、Alpaca および Dolly の英語指令を Google Translate を用いて 52 語に翻訳することで構築された。
- 各翻訳された指令に対する応答は、品質および一貫性を確保するための出力 distillation 技術を用いて GPT-4 によって生成された。
- 低ランク微調整(LoRA)を用いて、ベースモデル(BLOOM および LLaMA)を微調整し、モデル全体のパラメータ数に比べて著しく少ないパラメータ数のトレーニング可能なアダプタ行列を導入した。
- LoRA アダプタは、多言語データセット上でエンドツーエンドに訓練され、異なる言語または言語グループに対して即挿入可能な形でデプロイ可能である。
- 評価は、XCOPA、XStoryCloze、XWinograd、SentimentX、EXAMS といった複数の多言語ベンチマークを用い、GPT-4 および人的アノテーターを併用して実施された。
- 本手法は、データセット、コード、およびトレーニング済みアダプタ重みの公開により再現可能性を確保している。

実験結果
リサーチクエスチョン
- RQ1自動翻訳および応答 distillation を用いて構築された大規模多言語指令従属データセットが、多様な言語において高品質な指令微調整を達成できるか?
- RQ2低ランク微調整(LoRA)が、特にリソースが乏しい言語において、効果的でパラメータ効率の良い多言語モデルの指令微調整を可能にするか?
- RQ3Bactrian-X で LoRA で微調整されたモデルは、vanilla モデルおよび既存の指令微調整モデル(例:BLOOMZ、Alpaca)と比較して、ゼロショット多言語一般化性能で優れているか?
- RQ4基本モデルの事前学習に含まれない未学習言語に対しても、提案されたモデルはどの程度一般化性能を示すか?
- RQ5人的評価および GPT-4 スコアリングにより、提案されたモデルが多様な言語的・タスク的設定において優れていることが確認できるか?
主な発見
- BX${}_{\text{BLOOM}}$ および BX${}_{\text{LLaMA}}$ は、評価されたすべての多言語ベンチマークでベースモデルおよび指令微調整対応モデル(BLOOMZ および Alpaca)を上回った。
- 人的評価では、BX${}_{\text{BLOOM}}$ はアラビア語で平均順位スコア 86.7、インドネシア語で 80.0、中国語で 84.6 を記録し、BLOOMZ や Alpaca を顕著に上回った。
- BX${}_{\text{LLaMA}}$ は、BLOOM の事前学習に含まれなかったビルマ語で最高スコア 92.1、タガログ語で 81.7 を記録し、優れたゼロショット一般化性能を示した。
- XCOPA、XWinograd、XStoryCloze においても、高リソース言語および低リソース言語の両方で一貫した改善が得られ、最先端の性能を達成した。
- GPT-4 評価により、提案されたモデルがベースラインモデルよりも正確で整合性が高く、命令に整合した応答を生成することが確認された。
- Bactrian-X データセットには、52 語にわたる 340 万件の指令-応答ペアが含まれており、現時点で最大規模の汎用多言語指令データセットである。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。