[論文レビュー] Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier
Aya Expanseは、23ヶ国語で最先端の性能を達成する8Bおよび32Bパラメータの多言語言語モデルの新ファミリーを紹介する。多言語データのアービタージュ、好みに基づくアライメント、モデルマージを組み合わせることで実現した。これらのモデルは、Llama 3.1 70Bを含む先端のオープンウェイトモデルを上回り、m-ArenaHardでは54.0%の勝率を記録。同サイズのモデルとの比較では最大76.6%の勝率を達成した。
We introduce the Aya Expanse model family, a new generation of 8B and 32B parameter multilingual language models, aiming to address the critical challenge of developing highly performant multilingual models that match or surpass the capabilities of monolingual models. By leveraging several years of research at Cohere For AI and Cohere, including advancements in data arbitrage, multilingual preference training, and model merging, Aya Expanse sets a new state-of-the-art in multilingual performance. Our evaluations on the Arena-Hard-Auto dataset, translated into 23 languages, demonstrate that Aya Expanse 8B and 32B outperform leading open-weight models in their respective parameter classes, including Gemma 2, Qwen 2.5, and Llama 3.1, achieving up to a 76.6% win-rate. Notably, Aya Expanse 32B outperforms Llama 3.1 70B, a model with twice as many parameters, achieving a 54.0% win-rate. In this short technical report, we present extended evaluation results for the Aya Expanse model family and release their open-weights, together with a new multilingual evaluation dataset m-ArenaHard.
研究の動機と目的
- 単一言語モデルと多言語モデルの間の継続的な性能格差、特に低リソース言語および英語以外の言語において是正すること。
- 多様な言語的・文化的文脈におけるアライメントを向上させることで、多言語モデルのバイアスおよびセーフティ欠陊を軽減すること。
- トークナイゼーションとモデル効率の最適化により、低リソース言語の推論コストとレイテンシを低減すること。
- 高品質な多言語インstructチューニングを可能にすることで、言語のギャップを埋め、単一言語モデルの能力に匹敵またはそれを上回ること。
- オープンウェイトモデルと新しい多言語評価ベンチマーク、m-ArenaHardを提供することで、多言語AI分野の研究開発を加速すること。
提案手法
- 23ヶ国語で教師モデルの広範なプールから知識を抽出することで、高品質で多様なトレーニングデータを合成する多言語データアービタージュを採用する。
- 多言語の好み信号を用いて、人間の好みに基づく多言語の好み最適化とセーフティチューニングを実施し、アライメントと耐性を向上させる。
- 複数の専門的モデルを統合するモデルマージ技術を活用し、推論コストを増加させることなく、クロスリンガル転送と性能を向上させる。
- 多言語インstructデータセットを用いて、教師強化学習(SFT)および人間フィードバックからの強化学習(RLHF)によるベースモデルのファインチューニングを実施する。
- Arena-Hard-Autoデータセットを23ヶ国語に翻訳した新しい多言語評価ベンチマーク、m-ArenaHardを活用し、包括的なゼロショット評価を実現する。
- 低リソース言語でのパフォーマンス向上を図りながら、効率性とスケーラビリティを維持するため、モデルアーキテクチャとトレーニングレシピを最適化する。
実験結果
リサーチクエスチョン
- RQ1多言語言語モデルは、低リソース言語を含む多様な言語で、単一言語モデルと同等の性能を達成できるか?
- RQ2データアービタージュとモデルマージは、言語ファミリーごとのパフォーマンス格差をどれほど是正し、多言語一般化を向上させられるか?
- RQ3多言語の好みチューニングは、英語以外の言語において、モデルのアライメント、セーフティ、公平性にどのように影響を与えるか?
- RQ432Bパラメータのモデルは、2倍以上のパラメータを持つLlama 3.1 70Bを上回る性能を示せるか?
- RQ5合成データのキュレーションは、翻訳、推論、理解のベンチマークにおける多言語モデルのパフォーマンスにどのような影響を与えるか?
主な発見
- Aya Expanse 8Bは、m-ArenaHardにおいて、Gemma 2 9B や Qwen 2.5 7B といった先端のオープンウェイトモデルと23ヶ国語で比較した際、76.6%の勝率を記録した。
- Aya Expanse 32Bは、パラメータ数が2倍以上多いLlama 3.1 70Bを上回り、m-ArenaHardで54.0%の勝率を達成した。
- 多言語小学校算数ベンチマーク(MGSM)では、Aya Expanse 8Bが67.0の正答率を達成し、Aya 23 8Bと比較して1.8倍の改善を示し、全8Bクラスモデルを上回った。
- Aya Expanse 32BはMGSMで73.4の正答率を記録し、Aya 23 35Bと比較して19.7ポイントの向上を達成。Qwen 2.5 32B(59.7)とGemma 2 27B(61.5)を上回った。
- FLORESにおける機械翻訳では、Aya Expanse 8Bが57.2のchrF++と93.2のxCOMETを達成し、Gemma 2 9B(57.0 chrF++、91.8 xCOMET)を0.2 chrF++と1.4 xCOMET上回り、+2.9 BLEUに相当した。
- Aya Expanse 32Bは翻訳で最高スコア(58.8 chrF++、93.5 xCOMET)を記録し、32BクラスにおいてLlama 3.1 70BおよびMixtral 8x22Bをも上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。