Skip to main content
QUICK REVIEW

[论文解读] Explicit Alignment Objectives for Multilingual Bidirectional Encoders

Junjie Hu, Melvin Johnson|arXiv (Cornell University)|Oct 15, 2020
Topic Modeling参考文献 31被引用 10
一句话总结

该论文提出 amber,一种多语言双向编码器,通过两种新颖的目标显式对齐跨语言表征:词级注意力对齐与平行语料上的句子级对比学习。尽管参数量仅为 XLM-R-large 的 1/3.2,单语训练数据量也仅为后者的 1/23.8,amber 仍实现了最先进(SOTA)的零样本跨语言迁移性能,在 POS 标注任务上 F1 最高提升 1.1,在句子检索任务上准确率最高提升 27.3。

ABSTRACT

Pre-trained cross-lingual encoders such as mBERT (Devlin et al., 2019) and XLMR (Conneau et al., 2020) have proven to be impressively effective at enabling transfer-learning of NLP systems from high-resource languages to low-resource languages. This success comes despite the fact that there is no explicit objective to align the contextual embeddings of words/sentences with similar meanings across languages together in the same space. In this paper, we present a new method for learning multilingual encoders, AMBER (Aligned Multilingual Bidirectional EncodeR). AMBER is trained on additional parallel data using two explicit alignment objectives that align the multilingual representations at different granularities. We conduct experiments on zero-shot cross-lingual transfer learning for different tasks including sequence tagging, sentence retrieval and sentence classification. Experimental results show that AMBER obtains gains of up to 1.1 average F1 score on sequence tagging and up to 27.3 average accuracy on retrieval over the XLMR-large model which has 3.2x the parameters of AMBER. Our code and models are available at http://github.com/junjiehu/amber.

研究动机与目标

  • 解决仅通过掩码语言建模训练的多语言编码器缺乏显式跨语言对齐的问题。
  • 通过在预训练阶段引入平行语料的监督,提升零样本跨语言迁移性能。
  • 利用注意力一致性与对比学习,在词与句子两个层面增强对齐。
  • 证明少量平行数据可显著优于大规模单语预训练在跨语言迁移中的表现。
  • 表明显式对齐目标可提升在低资源设置下多种自然语言处理任务中的泛化能力。

提出的方法

  • 提出一种基于源到目标与目标到源注意力矩阵之间注意力一致性的词级对齐目标,灵感来源于机器翻译文献。
  • 应用一种句子级对比学习目标,促使模型在小批量句子对中预测出正确的翻译。
  • 使用掩码语言建模(MLM)、翻译语言建模(TLM)、词对齐(WA)与句子对齐(SA)目标的组合进行模型训练。
  • 对源句与目标句分别编码以实现句子级对齐,最终层表示取平均形成句子嵌入。
  • 通过计算源句与目标句嵌入之间余弦相似度的对比损失,优化对齐效果。
  • 在 26GB 平行数据与 80GB 单语维基百科数据上进行训练,最终模型远小于 XLM-R-large。

实验结果

研究问题

  • RQ1在词与句子层面引入显式对齐目标,能否提升多语言编码器在零样本跨语言迁移中的表现?
  • RQ2在仅使用更少参数与更少单语数据的情况下,显式对齐的小型模型性能是否优于参数量大得多、且在海量单语数据上训练的模型?
  • RQ3在预训练阶段引入平行数据,是否能带来比仅依赖掩码语言建模更优的跨语言表征对齐?
  • RQ4所提出的对齐目标在 POS 标注、句子检索与释义分类等多样化 NLP 任务中,性能提升程度如何?
  • RQ5在不同平行训练数据量的语言中,性能增益如何变化?

主要发现

  • 在零样本 POS 标注任务中,amber 的平均 F1 分数相比 XLM-R-large 提升 1.1,尽管其参数量仅为后者的 1/3.2。
  • 在句子检索任务中,amber 相比 XLM-R-large 实现了 27.3 的平均准确率提升,表明其在极小数据量下仍具备优越对齐能力。
  • 完整模型(MLM+TLM+WA+SA)在 Tatoeba 句子检索基准上达到 87.9% 的准确率,比 XLM-R-large 高出 27.3 分。
  • 即使仅使用 26GB 平行数据,amber 仍超越在 2.5TB 单语 CommonCrawl 数据上训练的 XLM-R-large。
  • 性能增益在低资源语言中最为显著,尤其是平行数据有限的语言,表明其具有强大的泛化能力。
  • 消融实验证明,词级与句子级对齐目标均贡献显著,其中句子级目标带来的提升最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。