Skip to main content
QUICK REVIEW

[论文解读] mLUKE: The Power of Entity Representations in Multilingual Pretrained Language Models

Ryokan Ri, Ikuya Yamada|arXiv (Cornell University)|Oct 15, 2021
Topic Modeling被引用 10
一句话总结

该论文提出了mLUKE,一种通过引入实体表征来增强多语言语言模型的模型,以提升跨语言迁移能力。通过在预训练和微调过程中同时结合词嵌入与实体嵌入,mLUKE在多语言问答、命名实体识别和关系抽取任务上均取得优异性能,同时通过利用语言无关的实体特征,在零样本完型任务中减少了语言偏差。

ABSTRACT

Recent studies have shown that multilingual pretrained language models can be effectively improved with cross-lingual alignment information from Wikipedia entities. However, existing methods only exploit entity information in pretraining and do not explicitly use entities in downstream tasks. In this study, we explore the effectiveness of leveraging entity representations for downstream cross-lingual tasks. We train a multilingual language model with 24 languages with entity representations and show the model consistently outperforms word-based pretrained models in various cross-lingual transfer tasks. We also analyze the model and the key insight is that incorporating entity representations into the input allows us to extract more language-agnostic features. We also evaluate the model with a multilingual cloze prompt task with the mLAMA dataset. We show that entity-based prompt elicits correct factual knowledge more likely than using only word representations. Our source code and pretrained models are available at https://github.com/studio-ousia/luke.

研究动机与目标

  • 探究实体表征是否能提升多语言语言模型中的跨语言迁移性能。
  • 探索实体表征在预训练之外的下游任务中如何被显式利用。
  • 评估基于实体的提示是否能减少多语言完型任务中的语言偏差。
  • 分析实体表征是否能提取比仅使用词表征更少语言依赖的特征。
  • 提供一种具备实体感知预训练与推理能力的多语言LUKE扩展版本。

提出的方法

  • 在24种语言的维基百科实体链接上,使用掩码语言建模(MLM)和掩码实体预测(MEP)对基于多语言BERT的模型进行预训练。
  • 通过将检测到的实体标记附加到输入序列中,将实体表征集成到输入中,使模型能够同时关注词和实体。
  • 将实体[MASK]标记的上下文表征作为语言无关特征,用于命名实体识别、关系抽取和问答等下游任务。
  • 在完型任务中应用基于实体的提示,通过使用实体[MASK]标记作为查询,从实体词汇表中激发模型的事实知识。
  • 使用结合MLM和MEP的联合目标进行模型训练,其中实体嵌入初始化自多语言知识库。
  • 在跨语言迁移任务上对mLUKE进行微调,使用基于词和增强实体的两种输入格式。

实验结果

研究问题

  • RQ1实体表征是否能提升多语言模型在跨语言迁移任务中的性能?
  • RQ2在零样本多语言提示中,使用实体表征是否能减少语言偏差?
  • RQ3在下游NLP任务中,基于实体的特征与仅使用词的特征相比表现如何?
  • RQ4实体[MASK]标记是否能作为提及级别分类任务的有效特征提取器?
  • RQ5实体表征在多大程度上促进了语言无关表征的学习?

主要发现

  • 在XQuAD和MLQA上,mLUKE-E(实体增强版)优于mBERT和mLUKE-W(仅词版),在零样本跨语言问答任务中分别取得78.5的F1和76.1的F1。
  • 在RELX和CoNLL命名实体识别任务中,mLUKE-E分别取得78.2的F1和89.1的F1,相较于基于词的基线模型表现出一致的性能提升。
  • 在完型提示任务中,mLUKE-E在法语中的Top-1错误率仅为27%,日语为44%,意大利语为30%,显著低于mBERT在法语中的71%错误率,表明其语言偏差更低。
  • 使用实体[MASK]标记的基于实体的提示比基于词的提示更能可靠地激发正确事实知识,尤其在低资源语言中表现更优。
  • 分析结果表明,实体表征提取了更多语言无关的特征,表现为零样本迁移性能提升以及语言特异性预测主导性的降低。
  • 该模型表明,实体表征不仅在预训练阶段有效,也能在显式下游特征提取中发挥作用,特别是当使用实体[MASK]表征作为可查询特征时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。