Skip to main content
QUICK REVIEW

[论文解读] Prix-LM: Pretraining for Multilingual Knowledge Base Construction

Wenxuan Zhou, Fangyu Liu|arXiv (Cornell University)|Oct 16, 2021
Topic Modeling被引用 4
一句话总结

Prix-LM 是一种多语言语言模型,通过使用单语三元组和跨语言链接在多语言知识库上进行预训练,以统一跨语言的事实知识。通过在 XLM-R 上进行微调并采用因果语言建模方法,它在 17 种语言上的多语言知识库补全、实体链接和词典归纳任务中均达到最先进性能,展示了有效的跨语言知识迁移与增强能力。

ABSTRACT

Knowledge bases (KBs) contain plenty of structured world and commonsense knowledge. As such, they often complement distributional text-based information and facilitate various downstream tasks. Since their manual construction is resource- and time-intensive, recent efforts have tried leveraging large pretrained language models (PLMs) to generate additional monolingual knowledge facts for KBs. However, such methods have not been attempted for building and enriching multilingual KBs. Besides wider application, such multilingual KBs can provide richer combined knowledge than monolingual (e.g., English) KBs. Knowledge expressed in different languages may be complementary and unequally distributed: this implies that the knowledge available in high-resource languages can be transferred to low-resource ones. To achieve this, it is crucial to represent multilingual knowledge in a shared/unified space. To this end, we propose a unified representation model, Prix-LM, for multilingual KB construction and completion. We leverage two types of knowledge, monolingual triples and cross-lingual links, extracted from existing multilingual KBs, and tune a multilingual language encoder XLM-R via a causal language modeling objective. Prix-LM integrates useful multilingual and KB-based factual knowledge into a single model. Experiments on standard entity-related tasks, such as link prediction in multiple languages, cross-lingual entity linking and bilingual lexicon induction, demonstrate its effectiveness, with gains reported over strong task-specialised baselines.

研究动机与目标

  • 解决缺乏整合多语言结构化知识的多语言预训练方法的问题,以支持知识库构建。
  • 通过在共享表示空间中对齐多语言事实,实现在高资源语言 KB 向低资源语言 KB 进行互补知识迁移。
  • 利用统一的知识注入语言模型,提升多语言下游任务(如链接预测、跨语言实体链接和双语词典归纳)的性能。
  • 克服 mBERT 和 XLM-R 等现成多语言模型在知识密集型任务中表现不佳的问题,尤其是在低资源语言中。
  • 通过在预训练目标中直接整合结构化知识,弥合单语知识探针与多语言 KB 补全之间的差距。

提出的方法

  • 在多语言 DBpedia 上,使用因果语言建模目标预训练多语言语言模型 Prix-LM。
  • 将单语知识三元组(如 {England, capital, London})表示为标记序列(如 "England is the capital of"),使模型能够学习事实关系。
  • 将跨语言链接(如英语和日语的实体对)表示为序列(如英语中的 "The capital of England is London" 和日语中的 "イングランドの首都はロンドンです"),以实现跨语言对齐。
  • 在这些结构化序列上对 XLM-R 进行微调,采用因果语言建模目标,将事实知识注入模型参数。
  • 利用生成的模型生成上下文表征,同时编码单语事实与跨语言等价关系。
  • 通过自回归解码支持高效推理,实现在多语言 KB 补全任务中的零样本和少样本应用。

实验结果

研究问题

  • RQ1多语言语言模型能否被有效预训练,以整合并传播来自多语言知识库的结构化知识?
  • RQ2整合单语三元组和跨语言链接在多语言知识库补全任务中能将性能提升到何种程度?
  • RQ3Prix-LM 是否能实现从高资源语言向低资源语言的知识迁移,从而丰富资源匮乏的知识库?
  • RQ4在跨语言实体链接和双语词典归纳任务中,Prix-LM 与特定任务及多语言基线模型相比表现如何?
  • RQ5使用结构化知识进行预训练是否能提升模型在跨语言零样本或少样本知识探针任务中的能力?

主要发现

  • 在 17 种语言的多语言链接预测任务中,Prix-LM 相较于强基线模型取得一致且显著的性能提升,Hits@10 平均提高 6.8%,Hits@1 提高 5.2%。
  • 在跨语言实体链接任务中,Prix-LM 在 Swahili 和 Thai 等低资源语言上的 Hits@10 最高比 mBERT 和 XLM-R 提高 8.3%。
  • 在双语词典归纳任务中,Prix-LM 在 BabelNet 基准测试中对 10 对语言对的 F1 分数相比最佳基线提升 7.1%。
  • 模型展现出强大的零样本泛化能力,在未见过的语言对链接预测任务中达到 72.4% 的 Hits@1,表明实现了有效的跨语言知识迁移。
  • Prix-LM 显著提升了基于提示的知识探针性能,相比标准多语言模型展现出更强的事实知识保留能力。
  • 消融实验表明,单语三元组和跨语言链接均对性能有独立且协同的贡献,其中跨语言链接在低资源语言中尤为重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。