[论文解读] Aya 23: Open Weight Releases to Further Multilingual Progress
Aya 23 发布开源权重,覆盖 23 种语言的 8B 和 35B 多语言模型,在深度和广度之间取得平衡,在 discriminative、generative 和 multilingual 任务上提升性能,超越 Aya 101 以及与之竞争的模型。
This technical report introduces Aya 23, a family of multilingual language models. Aya 23 builds on the recent release of the Aya model (Üstün et al., 2024), focusing on pairing a highly performant pre-trained model with the recently released Aya collection (Singh et al., 2024). The result is a powerful multilingual large language model serving 23 languages, expanding state-of-art language modeling capabilities to approximately half of the world's population. The Aya model covered 101 languages whereas Aya 23 is an experiment in depth vs breadth, exploring the impact of allocating more capacity to fewer languages that are included during pre-training. Aya 23 outperforms both previous massively multilingual models like Aya 101 for the languages it covers, as well as widely used models like Gemma, Mistral and Mixtral on an extensive range of discriminative and generative tasks. We release the open weights for both the 8B and 35B models as part of our continued commitment for expanding access to multilingual progress.
研究动机与目标
- 通过扩展语言覆盖范围超出英语,解决 LLM 的数据稀缺性与多语言性问题。
- 研究在预训练阶段将更多容量投入到较小语言集中的影响。
- 评估跨语言、跨语言的判别、生成和数学推理任务的多语言性能。
提出的方法
- 基础架构:基于 Cohere Command 系列的解码器式 Transformer,具并行注意力/前馈网络、SwiGLU、无偏置、RoPE 位置嵌入、256k BPE tokenizer。
- 通过多语言数据源的混合进行指令微调,包括多语言模板、人工注释、已翻译数据与合成数据,构建 1.63M 例的多语言微调集。
- 训练设置:13,200 次更新步、8192 的上下文长度、Adam 结合余弦学习率调度、峰值学习率 6e-4、末尾学习率 6e-5、批次大小 64、TPUv4,最多 128 pod 刀片。
- 模型变体:Aya-23-8B 与 Aya-23-35B,8B 模型采用 Grouped Query Attention (GQA),较大模型采用标准注意力。
- 评估框架:遵循 Üstün 等人 (2024) 的多语言评估及 eval-harness,用于判别任务、多语言 MMLU、MGSM、翻译与摘要,以及安全性/偏见评估。
实验结果
研究问题
- RQ1将模型容量集中在 23 种预训练语言上,是否能提升每种语言的单语言性能,相对于覆盖更广泛的多语言模型?
- RQ2Aya 23 模型在 23 种语言的判别、生成、翻译和数学推理任务中表现如何?
- RQ3在多语言环境中,Aya 23 模型的安全性与毒性特征相对于强基线有何区别?
- RQ4Aya 23 的开源权重发布是否真正扩展了多语言 NLP 的可及性和研究进展?
主要发现
- Aya 23-35B 在所评估的任务和语言上取得最高结果,优于 Aya 101 与竞争模型。
- Aya 23-8B 在较小模型中展现出一流的多语言性能,在判别任务上最高可提升 14%,在生成任务上最高可提升 20%,在多语言 MMLU 上最高可提升 41.6%,相较于 Aya 101。
- Aya 23 模型在多语言数学推理方面表现强劲,相较于 Aya 101,MGSM 的表现提升了 6.6 倍。
- 在开放式评估中,Aya 23 模型在 GPT-4 判定与人工评估中持续优于基线,特别是在非欧洲语言上。
- 安全性分析显示,Aya 23 相对于 Aya-101-13B 的有害回应减少,在更大模型中,在若干语言中有进一步降低有害性的趋势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。