[论文解读] DICT-MLM: Improved Multilingual Pre-Training using Bilingual Dictionaries
本文提出 DICT-MLM,一种多语言预训练方法,通过训练基于 BERT 的模型,不仅预测其原始语言中的掩码词,还利用双语词典预测其跨语言同义词,从而增强跨语言表征学习。该方法在零样本跨语言迁移任务中达到最先进性能,优于 mBERT 和使用昂贵平行语料库训练的模型,在 PAWS-X 上准确率最高提升 +5.3,在跨语言句子检索任务中提升超过 20%。
Pre-trained multilingual language models such as mBERT have shown immense gains for several natural language processing (NLP) tasks, especially in the zero-shot cross-lingual setting. Most, if not all, of these pre-trained models rely on the masked-language modeling (MLM) objective as the key language learning objective. The principle behind these approaches is that predicting the masked words with the help of the surrounding text helps learn potent contextualized representations. Despite the strong representation learning capability enabled by MLM, we demonstrate an inherent limitation of MLM for multilingual representation learning. In particular, by requiring the model to predict the language-specific token, the MLM objective disincentivizes learning a language-agnostic representation -- which is a key goal of multilingual pre-training. Therefore to encourage better cross-lingual representation learning we propose the DICT-MLM method. DICT-MLM works by incentivizing the model to be able to predict not just the original masked word, but potentially any of its cross-lingual synonyms as well. Our empirical analysis on multiple downstream tasks spanning 30+ languages, demonstrates the efficacy of the proposed approach and its ability to learn better multilingual representations.
研究动机与目标
- 通过激励模型预测跨语言同义词,解决标准掩码语言建模(MLM)在学习语言无关表征方面的局限性。
- 在不依赖昂贵平行语料库的前提下,提升零样本设置下的跨语言迁移性能。
- 证明低资源双语词典相比使用平行数据的现有方法,可显著增强多语言表征学习。
- 探究无可用词典的语言是否仍能从所提出的预训练方法中受益。
- 评估架构改进(如语言条件化层)在提升跨语言对齐能力方面的有效性。
提出的方法
- DICT-MLM 扩展了标准 MLM,允许模型预测掩码词在双语词典中的任意跨语言同义词,而不仅限于原始词汇。
- 在预训练过程中,掩码词被替换为双语词典中的多语言同义词,为同一上下文生成多样化的训练样本。
- 在 Transformer 编码器后添加语言条件化全连接层,通过基于目标语言的条件化来提升对跨语言同义词的预测能力。
- 修改输入层以引入语言嵌入,从而在训练期间提供明确的语言信号。
- 该方法仅使用来自双语词典的数千对跨语言词对,避免了对大规模平行语料库的依赖。
- 模型从零开始在 40 种语言类型多样的单语语料库上进行预训练,并通过同义词替换进行数据增强。
实验结果
研究问题
- RQ1一种鼓励预测跨语言同义词的预训练目标,是否能在标准 MLM 之外进一步提升多语言表征学习?
- RQ2仅使用双语词典(而非昂贵的平行语料库)是否能在跨语言迁移任务中实现具有竞争力或更优的性能?
- RQ3如语言条件化层等架构改进,在多大程度上增强了模型在不同语言间泛化的能力?
- RQ4无公开双语词典的语言是否仍能从 DICT-MLM 预训练中受益?
- RQ5在多样化自然语言处理任务中,DICT-MLM 与 mBERT 及其他最先进模型相比,在零样本跨语言迁移中的表现如何?
主要发现
- DICT-MLM 在所有评估任务中均优于 mBERT,命名实体识别(NER)的 F1 值提升 +2.4,词性标注(POS)的准确率提升 +3.7(所有语言)。
- 在 XNLI 上获得 +0.5 准确率提升,在 MLDOC-Headline 上获得 +2.5 准确率提升,表明其具备强大的零样本泛化能力。
- 在 TATOEBA 跨语言句子检索基准上,DICT-MLM 提升超过 20%,表明其具有显著更好的跨语言对齐能力。
- PAWS-X 获得最大提升,准确率提高 +5.3,凸显其在句子级语义相似性任务中的有效性。
- 即使无可用双语词典的语言也从 DICT-MLM 预训练中受益,表明其在低资源语言上的更广泛应用潜力。
- 消融研究显示,语言条件化层在 NER 任务中特别有益,而其移除在 POS 和 PAWS-X 任务上略有提升,表明其效果具有任务依赖性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。