[论文解读] When Is Multilinguality a Curse? Language Modeling for 250 High- and Low-Resource Languages
本研究探讨了多语言预训练对252种高资源与低资源语言语言建模性能的影响。基于超过10,000个单语和多语言模型的实验发现,当新增语言在句法上相似时,适度的多语言数据可提升低资源语言的性能(相当于增加33%的单语数据),但会损害高资源语言的性能(相当于损失超过85%的单语数据),揭示了由于模型容量有限而产生的‘多语言诅咒’现象。
Multilingual language models are widely used to extend NLP systems to low-resource languages. However, concrete evidence for the effects of multilinguality on language modeling performance in individual languages remains scarce. Here, we pre-train over 10,000 monolingual and multilingual language models for over 250 languages, including multiple language families that are under-studied in NLP. We assess how language modeling performance in each language varies as a function of (1) monolingual dataset size, (2) added multilingual dataset size, (3) linguistic similarity of the added languages, and (4) model size (up to 45M parameters). We find that in moderation, adding multilingual data improves low-resource language modeling performance, similar to increasing low-resource dataset sizes by up to 33%. Improvements depend on the syntactic similarity of the added multilingual data, with marginal additional effects of vocabulary overlap. However, high-resource languages consistently perform worse in multilingual pre-training scenarios. As dataset sizes increase, adding multilingual data begins to hurt performance for both low-resource and high-resource languages, likely due to limited model capacity (the "curse of multilinguality"). These results suggest that massively multilingual pre-training may not be optimal for any languages involved, but that more targeted models can significantly improve performance.
研究动机与目标
- 评估多语言预训练对不同语言家族中各类语言语言建模性能的影响。
- 分离多语言数据集规模、语言相似性(句法与词汇相似性)以及模型规模对性能的影响。
- 将多语言预训练结果与单语基线进行比较,量化性能增益或损失。
- 探究‘多语言诅咒’——即随着多语言数据增加而出现的性能下降——是否在低资源和高资源语言中均存在。
- 为设计更高效、更具针对性的多语言模型而非庞大统一的模型提供可操作的见解。
提出的方法
- 针对252种语言,使用不同规模的单语数据集预训练超过1,900个单语模型,以建立基线性能。
- 通过控制多语言数据集规模、语言选择和模型规模(最高达45M参数),预训练超过8,400个多语言模型。
- 为所有252种语言使用固定的单语分词器,以确保多语言模型之间的困惑度比较有效。
- 通过困惑度衡量性能,并将多语言数据的影响量化为等效的单语数据集规模变化。
- 使用目标语言与新增语言之间的句法和词汇相似性度量来评估语言相似性。
- 跨语言家族和资源水平分析结果,以识别性能增益与损失的模式。
实验结果
研究问题
- RQ1在低资源语言中,添加多语言数据如何影响语言建模性能?其等效的单语数据增益是多少?
- RQ2目标语言与多语言数据之间的句法和词汇相似性如何影响性能提升?
- RQ3为何多语言预训练在高资源语言中始终导致性能下降?
- RQ4在何种程度上,随着多语言数据的增加,其性能开始对低资源和高资源语言均造成损害?
- RQ5在何种条件下,多语言预训练对单个语言有益或有害?
主要发现
- 当新增语言在句法上相似时,添加多语言数据可使低资源语言建模性能提升最多达33%的等效单语数据增加。
- 词汇重叠对性能增益仅有微弱影响,表明句法相似性是多语言迁移中的主导因素。
- 高资源语言在多语言模型中始终出现性能下降,某些情况下等效于损失超过85%的单语训练数据。
- 随着多语言数据集规模的增加,低资源和高资源语言的性能均出现下降,表明由于模型容量有限,存在‘多语言诅咒’现象。
- 当新增语言在句法上相似且模型容量足够时,多语言预训练的益处才局限于低资源语言。
- 大规模多语言预训练可能对任何语言均非最优,提示更具针对性的模型设计可显著提升性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。