[论文解读] Should we Stop Training More Monolingual Models, and Simply Use Machine Translation Instead?
本文提出以将低资源语言数据翻译成英语,再对大型预训练英语模型进行微调,来替代训练单语低资源语言模型。利用最先进的翻译模型和大型英语模型(如 BERT-large),该方法在北欧语言中实现了优越或相当的性能——唯独芬兰语除外,表明基于翻译的迁移方法在实证效果和环境效率上均优于训练原生模型。
Most work in NLP makes the assumption that it is desirable to develop solutions in the native language in question. There is consequently a strong trend towards building native language models even for low-resource languages. This paper questions this development, and explores the idea of simply translating the data into English, thereby enabling the use of pretrained, and large-scale, English language models. We demonstrate empirically that a large English language model coupled with modern machine translation outperforms native language models in most Scandinavian languages. The exception to this is Finnish, which we assume is due to inferior translation quality. Our results suggest that machine translation is a mature technology, which raises a serious counter-argument for training native language models for low-resource languages. This paper therefore strives to make a provocative but important point. As English language models are improving at an unprecedented pace, which in turn improves machine translation, it is from an empirical and environmental stand-point more effective to translate data from low-resource languages into English, than to build language models for such languages.
研究动机与目标
- 挑战在北欧国家等低资源语言中训练单语模型的普遍做法。
- 探究将低资源语言数据通过机器翻译转为英语,再在大型英语模型上进行微调,是否能优于原生语言模型。
- 评估训练原生模型与通过翻译利用现有大规模英语模型之间的实证与环境权衡。
- 评估翻译质量与模型规模在低资源设置下游性能中的影响。
- 确定通过翻译从英语模型进行迁移学习是否是一种可行、可扩展且更高效的原生模型替代方案。
提出的方法
- 使用先进的预训练机器翻译系统,将北欧语言(瑞典语、挪威语、丹麦语、芬兰语)的训练数据翻译成英语。
- 在翻译后的数据上对大型预训练英语语言模型(如 BERT-base 和 BERT-large)进行微调,以实现情感分类。
- 将翻译数据微调模型的性能与在每种北欧语言中本地训练的单语模型进行比较。
- 使用 XLM-RoBERTa-large 作为在大规模多语言数据上预训练的多语言基线模型,以评估迁移学习性能。
- 使用标准 NLP 指标(如准确率)在每种语言的保留测试集上评估所有模型。
- 分析不同语言间的性能差异,特别关注语言类型学相似性与翻译质量的影响。
实验结果
研究问题
- RQ1将低资源语言数据翻译成英语,并使用大型预训练英语模型,是否能优于在原生语言中训练单语模型?
- RQ2在北欧语言中,微调于翻译数据的英语模型性能与原生单语模型相比如何?
- RQ3机器翻译质量在基于翻译的方法成功中扮演何种角色,特别是在语言类型学上差异较大的语言(如芬兰语)中?
- RQ4当使用翻译数据时,目标英语模型的预训练数据规模是否显著影响下游性能?
- RQ5从实证与环境角度出发,在何种场景下翻译至英语的方法比训练原生模型更有效?
主要发现
- 在翻译数据上微调的大型英语 BERT-large 模型在瑞典语、挪威语和丹麦语中均优于所有原生单语模型,分别达到 97.16%、96.56% 和 97.48% 的准确率。
- 对于芬兰语,原生 BERT 模型达到 95.72% 的准确率,优于最佳翻译英语模型的 94.84%,表明语言类型学差异导致的翻译质量限制了性能。
- 在翻译后的瑞典语数据上,英语 BERT-base 模型达到 95.76% 的准确率,比同一测试集上原生瑞典语 BERT 模型的 96.76% 低 1.00 个百分点。
- XLM-RoBERTa-large 在 2950 亿 token 的多语言数据上预训练,除芬兰语外在所有语言中均达到最先进结果,其中丹麦语的最佳结果来自翻译数据。
- 翻译质量是主要瓶颈:BERT-large 在翻译后的芬兰语数据上表现较差,与翻译质量较低相关,表明翻译质量直接影响下游模型性能。
- 该方法在语言类型学上相似的语言(如北欧语言与英语)中最为有效,因为此时翻译质量高且迁移效应强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。