Skip to main content
QUICK REVIEW

[论文解读] Aya Expanse: Combining Research Breakthroughs for a New Multilingual Frontier

John Dang, Shivalika Singh|arXiv (Cornell University)|Dec 5, 2024
Second Language Learning and TeachingArts and Humanities被引用 3
一句话总结

Aya Expanse 引入了一类新的 8B 和 32B 参数多语言语言模型,通过结合多语言数据套利、基于偏好的对齐以及模型融合技术,在 23 种语言上实现了最先进性能。这些模型在 m-ArenaHard 上取得了 54.0% 的胜率,超越了领先的开源模型(包括 Llama 3.1 70B),在与相似尺寸模型的对比中最高达到 76.6% 的胜率。

ABSTRACT

We introduce the Aya Expanse model family, a new generation of 8B and 32B parameter multilingual language models, aiming to address the critical challenge of developing highly performant multilingual models that match or surpass the capabilities of monolingual models. By leveraging several years of research at Cohere For AI and Cohere, including advancements in data arbitrage, multilingual preference training, and model merging, Aya Expanse sets a new state-of-the-art in multilingual performance. Our evaluations on the Arena-Hard-Auto dataset, translated into 23 languages, demonstrate that Aya Expanse 8B and 32B outperform leading open-weight models in their respective parameter classes, including Gemma 2, Qwen 2.5, and Llama 3.1, achieving up to a 76.6% win-rate. Notably, Aya Expanse 32B outperforms Llama 3.1 70B, a model with twice as many parameters, achieving a 54.0% win-rate. In this short technical report, we present extended evaluation results for the Aya Expanse model family and release their open-weights, together with a new multilingual evaluation dataset m-ArenaHard.

研究动机与目标

  • 解决单语模型与多语言模型之间持续存在的性能差距,尤其是在低资源语言和非英语语言上的表现。
  • 通过在多样化语言和文化背景下的改进对齐,缓解多语言模型中的偏见和安全缺陷。
  • 通过优化分词和模型效率,降低低资源语言的推理成本和延迟。
  • 通过实现高质量的多语言指令微调,缩小语言差距,使其性能达到或超过单语模型。
  • 通过开源权重模型和新的多语言评估基准 m-ArenaHard,加速多语言人工智能的研究与开发。

提出的方法

  • 利用多语言数据套利,通过从涵盖 23 种语言的广泛教师模型池中蒸馏知识,合成高质量、多样化的训练数据。
  • 使用跨语言的人类偏好信号,实施多语言偏好优化与安全调优,以提升对齐性和鲁棒性。
  • 采用模型融合技术,整合多个专用模型,提升跨语言迁移能力与性能,同时不增加推理成本。
  • 在多语言指令数据集上,通过监督微调(SFT)和基于人类反馈的强化学习(RLHF)对基础模型进行微调。
  • 利用新的多语言评估基准 m-ArenaHard,将 Arena-Hard-Auto 数据集翻译成 23 种语言,实现全面的零样本评估。
  • 优化模型架构与训练方案,提升在低资源语言上的表现,同时保持高效性与可扩展性。

实验结果

研究问题

  • RQ1多语言语言模型是否能在包括低资源语言在内的多种语言上实现与单语模型相当的性能?
  • RQ2数据套利与模型融合在多语言泛化能力提升及不同语系间性能差异缩小方面,能发挥多大作用?
  • RQ3多语言偏好微调在非英语语言中如何影响模型的对齐性、安全性和公平性?
  • RQ432B 参数模型是否能在多语言推理与指令遵循任务中超越参数量超过两倍的 Llama 3.1 70B 模型?
  • RQ5合成数据的精心构建对多语言模型在翻译、推理与理解基准上的性能有何影响?

主要发现

  • Aya Expanse 8B 在 m-ArenaHard 上与 Gemma 2 9B 和 Qwen 2.5 7B 等领先开源模型在 23 种语言上的两两对比中,取得了 76.6% 的胜率。
  • Aya Expanse 32B 在 m-ArenaHard 上以 54.0% 的胜率超越了参数量超过两倍的 Llama 3.1 70B 模型。
  • 在多语言小学数学基准(MGSM)上,Aya Expanse 8B 达到 67.0 的准确率,较 Aya 23 8B 提升 1.8 倍,并超越所有 8B 级别模型。
  • Aya Expanse 32B 在 MGSM 上取得 73.4 的准确率,较 Aya 23 35B 提升 19.7 分,超过 Qwen 2.5 32B(59.7)和 Gemma 2 27B(61.5)。
  • 在 FLORES 机器翻译任务中,Aya Expanse 8B 达到 57.2 chrF++ 和 93.2 xCOMET,分别优于 Gemma 2 9B 的 57.0 chrF++ 和 91.8 xCOMET,提升 0.2 chrF++ 和 1.4 xCOMET,相当于 +2.9 BLEU。
  • Aya Expanse 32B 在翻译任务中取得最高分(58.8 chrF++ 和 93.5 xCOMET),在 32B 级别中超越 Llama 3.1 70B 和 Mixtral 8x22B。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。