Skip to main content
QUICK REVIEW

[论文解读] Co-training Embeddings of Knowledge Graphs and Entity Descriptions for Cross-lingual Entity Alignment

Muhao Chen, Yingtao Tian|arXiv (Cornell University)|Jun 18, 2018
Topic Modeling被引用 11
一句话总结

本文提出KDCoE,一种协同训练框架,联合学习多语言知识图谱嵌入与实体描述嵌入,以提升跨语言实体对齐性能。通过在弱对齐的三语维基百科数据集上,迭代地利用两个模型的置信预测来优化对齐,KDCoE显著优于先前方法,在实体对齐、零样本对齐和跨语言知识图谱补全任务中均达到最先进性能。

ABSTRACT

Multilingual knowledge graph (KG) embeddings provide latent semantic representations of entities and structured knowledge with cross-lingual inferences, which benefit various knowledge-driven cross-lingual NLP tasks. However, precisely learning such cross-lingual inferences is usually hindered by the low coverage of entity alignment in many KGs. Since many multilingual KGs also provide literal descriptions of entities, in this paper, we introduce an embedding-based approach which leverages a weakly aligned multilingual KG for semi-supervised cross-lingual learning using entity descriptions. Our approach performs co-training of two embedding models, i.e. a multilingual KG embedding model and a multilingual literal description embedding model. The models are trained on a large Wikipedia-based trilingual dataset where most entity alignment is unknown to training. Experimental results show that the performance of the proposed approach on the entity alignment task improves at each iteration of co-training, and eventually reaches a stage at which it significantly surpasses previous approaches. We also show that our approach has promising abilities for zero-shot entity alignment, and cross-lingual KG completion.

研究动机与目标

  • 解决多语言知识图谱中跨语言链接稀疏的问题,该问题限制了跨语言推理的质量。
  • 利用多语言实体描述作为监督信号的替代来源,在跨语言链接有限时增强跨语言对齐能力。
  • 开发一种半监督协同训练框架,通过相互监督交替优化知识图谱嵌入与描述嵌入。
  • 利用共享的多语言表示,实现零样本跨语言实体对齐,并提升跨语言知识图谱补全性能。
  • 证明结合结构化知识与文本描述可实现稳健的多语言表征学习。

提出的方法

  • 使用带线性变换的翻译模型训练多语言知识图谱嵌入模型,实现跨语言对齐。
  • 使用注意力门控循环单元(AGRU)与多语言词嵌入训练描述嵌入模型,以编码实体描述。
  • 通过交替从每个模型中选择最置信的预测跨语言链接(ILLs)作为另一模型的伪标签,实现协同训练。
  • 采用联合优化目标,对齐两种模态(知识图谱结构与描述)中跨语言实体对的嵌入。
  • 利用英语作为中介语言,在知识图谱补全任务中实现跨语言预测,从而在低资源语言中支持推理。
  • 应用多语言词嵌入(如多语言Skip-gram)以提升描述编码器中的跨语言语义对齐。

实验结果

研究问题

  • RQ1当仅有少量跨语言链接可用时,KG嵌入与实体描述嵌入之间的协同训练是否能提升跨语言实体对齐性能?
  • RQ2所提方法在零样本实体对齐任务中的有效性如何,即推理过程中不使用真实对齐标签?
  • RQ3KG与描述嵌入的联合学习是否能提升低资源语言设置下的跨语言知识图谱补全性能?
  • RQ4自注意力机制与多语言词嵌入在建模实体描述中跨语言语义相似性方面有何贡献?
  • RQ5协同训练过程是否在多轮迭代中持续带来性能增益,且是否超越现有最先进模型?

主要发现

  • KDCoE在跨语言实体对齐任务中显著优于先前方法,零样本设置下Hit@1提升4.04%,Hit@10提升11.97%。
  • 基于AGRU的描述编码器优于单层网络、CNN与GRU基线模型,证明注意力机制与多语言嵌入的重要性。
  • 协同训练在多轮迭代中持续带来性能提升,表现出稳定的收敛性与两模型间的相互促进。
  • KDCoE的单语言预测变体性能与TransE相当,证实其在保持单语言知识图谱结构质量方面的有效性。
  • 利用英语作为中介的跨语言预测显著优于单语言预测,证明了跨语言知识迁移的可行性。
  • 该方法可实现有效的跨语言知识图谱补全,为未来基于多语言桥梁的多语言集成方法提供了潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。