[论文解读] Multilingual BERT Post-Pretraining Alignment
本文提出了一种后预训练对齐(PPA)方法,通过联合应用基于改进的翻译语言建模(TLM)目标的自监督词级对齐,以及基于MoCo的对比学习句级对齐,提升多语言BERT的跨语言迁移能力。该方法在XNLI上的零样本性能相比mBERT提升了4.7%,且在参数量仅为其57%的情况下超越了XLM-R Base,同时仅使用了XLM平行数据的18%以下。
We propose a simple method to align multilingual contextual embeddings as a post-pretraining step for improved zero-shot cross-lingual transferability of the pretrained models. Using parallel data, our method aligns embeddings on the word level through the recently proposed Translation Language Modeling objective as well as on the sentence level via contrastive learning and random input shuffling. We also perform sentence-level code-switching with English when finetuning on downstream tasks. On XNLI, our best model (initialized from mBERT) improves over mBERT by 4.7% in the zero-shot setting and achieves comparable result to XLM for translate-train while using less than 18% of the same parallel data and 31% less model parameters. On MLQA, our model outperforms XLM-R_Base that has 57% more parameters than ours.
研究动机与目标
- 在不从头训练的前提下提升mBERT的跨语言迁移能力。
- 解决依赖FastAlign等噪声词对齐工具的后处理对齐方法的局限性。
- 开发一种自监督、数据高效的对齐方法,仅使用极少的平行数据。
- 在零样本和翻译微调设置下提升多语言NLP任务的性能。
- 探索在微调过程中使用语言切换作为对齐与数据增强的一种形式。
提出的方法
- 该方法使用改进的TLM目标实现词级对齐,将源语言和目标语言句子拼接,且不重置token位置或使用语言嵌入。
- 通过基于MoCo的对比学习在[CLS]标记上实现句级对齐,采用动量编码器和负样本队列。
- 在平行句子对上以多任务方式联合训练TLM和对比学习目标。
- 在NLI和QA任务的微调过程中,对英语与目标语言句子实施句级语言切换,以进一步对齐表示。
- 该方法避免依赖预训练的词对齐工具,减少由噪声对齐带来的误差传播。
- 该方法作为mBERT的后预训练步骤应用,保留其原始初始化的同时优化跨语言对齐。
实验结果
研究问题
- RQ1自监督的词级与句级对齐是否能提升mBERT的零样本跨语言迁移性能?
- RQ2在仅使用极少平行数据并结合对比学习与改进TLM的方法是否优于现有后处理对齐方法?
- RQ3在微调过程中使用语言切换是否能进一步增强对齐效果并提升模型性能?
- RQ4与XLM和XLM-R相比,该方法在性能与资源效率方面表现如何?
- RQ5当使用显著更少的参数和更少的平行数据时,该方法是否能保持或提升性能?
主要发现
- 在XNLI零样本基准上,所提模型相比mBERT性能提升了4.7%。
- 在翻译微调设置下,该模型性能与XLM相当,但仅使用了XLM平行数据的18%以下,且参数量减少了31%。
- 在MLQA上,该模型优于参数量多出57%的XLM-R Base。
- 消融实验表明,词级与句级对齐组件均对性能提升有显著贡献。
- 在微调过程中使用英语-目标语言混合语言切换提供了额外的对齐信号,并提升了下游任务性能。
- 该方法展现出强大的效率优势,在极少平行数据和更小模型规模下实现了最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。