[论文解读] VECO: Variable and Flexible Cross-lingual Pre-training for Language Understanding and Generation
VECO 提出了一种即插即用的交叉注意力模块,集成于多语言 Transformer 编码器中,以在预训练期间显式对齐跨语言表征,从而实现语言理解与生成任务的灵活部署。它在 XTREME 基准测试中取得最先进结果,并通过一种新颖的 CA-MLM 目标,将 WMT14 翻译性能提升 1–2 BLEU 分,从而增强双语上下文建模能力。
Existing work in multilingual pretraining has demonstrated the potential of cross-lingual transferability by training a unified Transformer encoder for multiple languages. However, much of this work only relies on the shared vocabulary and bilingual contexts to encourage the correlation across languages, which is loose and implicit for aligning the contextual representations between languages. In this paper, we plug a cross-attention module into the Transformer encoder to explicitly build the interdependence between languages. It can effectively avoid the degeneration of predicting masked words only conditioned on the context in its own language. More importantly, when fine-tuning on downstream tasks, the cross-attention module can be plugged in or out on-demand, thus naturally benefiting a wider range of cross-lingual tasks, from language understanding to generation. As a result, the proposed cross-lingual model delivers new state-of-the-art results on various cross-lingual understanding tasks of the XTREME benchmark, covering text classification, sequence labeling, question answering, and sentence retrieval. For cross-lingual generation tasks, it also outperforms all existing cross-lingual models and state-of-the-art Transformer variants on WMT14 English-to-German and English-to-French translation datasets, with gains of up to 1~2 BLEU.
研究动机与目标
- 解决现有多语言模型中仅依赖自注意力进行语言间对齐时存在的跨语言注意力模式薄弱的问题。
- 通过在预训练期间显式建模语言之间的依赖关系,改进跨语言表征学习。
- 通过按需集成交叉注意力,统一单一模型架构以同时支持跨语言语言理解(NLU)与生成(NLG)任务。
- 克服现有仅编码器或编码器-解码器模型在优化某一类任务时牺牲另一类任务性能的局限性。
- 通过一种新型预训练目标 CA-MLM,更好地利用双语平行数据,该目标结合了掩码语言建模与交叉注意力。
提出的方法
- 将即插即用的交叉注意力模块集成到 Transformer 编码器中,其中查询来自一种语言的表征,键和值来自另一种语言的表征,从而实现显式的跨语言注意力。
- 提出一种新颖的预训练目标 CA-MLM(交叉注意力掩码语言建模),使被掩码的标记能够通过交叉注意力模块同时关注其自身语言的上下文和另一语言的完整上下文。
- 通过在预训练期间允许模型在不使用交叉注意力模块的情况下预测被掩码的标记,保持原始编码器的双向上下文建模能力。
- 通过支持根据下游任务灵活地启用或禁用交叉注意力模块,实现对 NLU 或 NLG 任务的优化,从而支持灵活微调。
- 使用 CA-MLM 与 TLM 目标相结合的方式,在单语和双语数据上预训练模型,以增强跨语言对齐能力。
- 在所有语言间使用共享的子词词汇表,并应用标准的掩码语言建模与翻译语言建模作为辅助目标。
实验结果
研究问题
- RQ1与仅通过自注意力实现的隐式注意力相比,预训练期间显式地在语言之间引入交叉注意力是否能改善跨语言表征对齐?
- RQ2即插即用的交叉注意力机制是否能使统一模型在语言理解与生成任务中均优于专用模型?
- RQ3CA-MLM 目标是否能比传统 MLM 与 TLM 的组合更有效地利用双语平行数据?
- RQ4在跨语言基准测试中,支持按需启用交叉注意力的统一模型性能是否优于专用的仅编码器或编码器-解码器模型?
- RQ5在微调阶段通过启用或禁用交叉注意力模块所带来的灵活性,是否能在多种下游任务中持续带来性能提升?
主要发现
- VECO 在 XTREME 基准测试中取得新的最先进结果,在文本分类、序列标注、阅读理解与句子检索等多个跨语言理解任务上优于 XLM 与 XLM-R。
- 在 IWSLT14 英语到德语翻译任务中,VECO 相较于 XLM 提升了最高 2.1 个 BLEU 分,相较于 mBART 提升了 1.5 个 BLEU 分,显示出在跨语言生成任务中的显著优势。
- 消融实验表明,将 CA-MLM 与 TLM 结合使用时,在 XNLI 和 IWSLT14 上分别取得 67.7 和 36.0 的 BLEU 分数,显著优于仅使用 MLM 或 TLM 训练的模型。
- 与 XLM 相比,使用 CA-MLM 进行预训练使 XNLI 上提升 3.2 分,IWSLT14 上提升 2.1 分,表明双语数据得到了更有效的利用。
- 尽管 mBART 专为生成任务设计,但在 XNLI 上仍比 VECO 低近 6 分,表明联合预训练并结合显式交叉注意力对 NLU 任务更为有效。
- 即插即用的微调策略(在微调阶段启用交叉注意力)进一步提升了 NLU 任务的性能,证实了双语上下文融合的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。