[论文解读] XLM-K: Improving Cross-Lingual Language Model Pre-training with Multilingual Knowledge
XLM-K 通过引入两种新颖的预训练任务——掩码实体预测和对象蕴含——增强了跨语言语言建模,整合了多语言知识。通过利用多语言知识库来提升对实体和关系的理解,XLM-K 在 MLQA、NER 和 XNLI 上实现了最先进(SOTA)的性能,尤其在知识密集型和跨语言迁移任务中表现显著。
Cross-lingual pre-training has achieved great successes using monolingual and bilingual plain text corpora. However, most pre-trained models neglect multilingual knowledge, which is language agnostic but comprises abundant cross-lingual structure alignment. In this paper, we propose XLM-K, a cross-lingual language model incorporating multilingual knowledge in pre-training. XLM-K augments existing multilingual pre-training with two knowledge tasks, namely Masked Entity Prediction Task and Object Entailment Task. We evaluate XLM-K on MLQA, NER and XNLI. Experimental results clearly demonstrate significant improvements over existing multilingual language models. The results on MLQA and NER exhibit the superiority of XLM-K in knowledge related tasks. The success in XNLI shows a better cross-lingual transferability obtained in XLM-K. What is more, we provide a detailed probing analysis to confirm the desired knowledge captured in our pre-training regimen. The code is available at https://github.com/microsoft/Unicoder/tree/master/pretraining/xlmk.
研究动机与目标
- 为解决现有多语言模型在捕捉跨语言知识(如跨语言的实体和关系语义)方面的局限性。
- 通过在预训练中引入与语言无关的多语言知识,超越单语和双语文本,提升跨语言迁移能力。
- 设计知识感知的预训练任务,显式地将结构化和描述性知识注入多语言表示中。
- 评估知识整合在需要事实性知识和跨语言对齐的下游任务中的有效性。
- 提供实证和探针证据,证明模型在预训练过程中捕捉到了预期的知识表征。
提出的方法
- 提出掩码实体预测(MEP)任务,模型通过多语言知识库中的实体描述来预测句子中被掩码的实体。
- 提出对象蕴含(OE)任务,要求模型基于主语和关系,利用知识库中的跨语言描述预测对象实体。
- 在预训练中使用对比学习,以区分正样本知识实例(正确实体对)与负样本。
- 将两种知识任务与标准的掩码语言建模(MLM)和翻译语言建模(TLM)结合,采用多任务预训练机制。
- 利用多语言知识库(如 Wikidata)获取多语言下的实体描述和三元组($<$subject, relation, object$>$)。
- 采用双编码器结构,通过多语言描述对主语和对象进行编码,以实现跨语言对齐。
实验结果
研究问题
- RQ1将多语言知识整合到预训练中,是否能提升下游任务的跨语言迁移性能?
- RQ2如掩码实体预测和对象蕴含等知识感知预训练任务,如何影响模型捕捉事实性知识的能力?
- RQ3XLM-K 在知识密集型基准(如 MLQA 和 NER)上,相较于 XLM-R 等现有多语言模型,优势有多大?
- RQ4多语言知识的引入是否增强了模型在开放域问答和常识推理方面的能力?
- RQ5有哪些证据表明模型在预训练过程中学习并保留了结构化和描述性知识?
主要发现
- XLM-K 在 MLQA 和 NER 上实现了最先进性能,相较于 XLM-R 和其他多语言模型有显著提升,尤其在知识密集型场景中。
- 在 XNLI 基准上,XLM-K 展现出卓越的跨语言迁移能力,优于现有模型,且无需使用双语数据。
- 消融实验表明,掩码实体预测和对象蕴含任务均独立贡献性能提升,分别在 Google-RE 上提升 0.6 和 2.5 分。
- 在 LAMA 探针任务中,XLM-K 在 SQuAD 上相较 XLM-R base 提升 6.0 分,在 T-REx 上总得分为 29.7,优于所有基线模型。
- 案例研究证实,XLM-K 正确预测了如“1984”为 Tasila Mwale 出生年份、“food”为 Gnocchi 的类别,而 XLM-R base 则失败。
- 探针分析证实,XLM-K 有效捕捉了结构化和描述性知识,有明确证据表明其事实性知识整合能力得到提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。