Skip to main content
QUICK REVIEW

[论文解读] Matching Entities Across Different Knowledge Graphs with Graph Embeddings

Michael Azmy, Peng Shi|arXiv (Cornell University)|Mar 15, 2019
Advanced Graph Neural Networks参考文献 15被引用 13
一句话总结

本文提出了一种简单而有效的方法,通过结合RDF2Vec图嵌入与多层感知机(MLP),实现DBpedia与Wikidata之间模糊实体的匹配。尽管训练数据极少,该方法仍实现了高准确率,表明图嵌入能够捕捉足够的语义上下文,以支持跨知识图谱的实体对齐。

ABSTRACT

This paper explores the problem of matching entities across different knowledge graphs. Given a query entity in one knowledge graph, we wish to find the corresponding real-world entity in another knowledge graph. We formalize this problem and present two large-scale datasets for this task based on exiting cross-ontology links between DBpedia and Wikidata, focused on several hundred thousand ambiguous entities. Using a classification-based approach, we find that a simple multi-layered perceptron based on representations derived from RDF2Vec graph embeddings of entities in each knowledge graph is sufficient to achieve high accuracy, with only small amounts of training data. The contributions of our work are datasets for examining this problem and strong baselines on which future work can be based.

研究动机与目标

  • 解决当不同知识图谱中的实体共享相同名称但指向不同现实世界实体时的匹配挑战。
  • 构建大规模、高质量的基准数据集,聚焦于模糊实体,以支持跨知识图谱实体匹配的研究。
  • 利用图嵌入与前馈神经网络建立强大而简单的基线模型,以在该任务上超越线性模型的表现。
  • 证明极少的标注数据即可实现高性能,表明低资源实体对齐的可行性。
  • 研究候选集大小与训练数据量对模型性能的影响,以指导未来系统设计。

提出的方法

  • 通过使用OWL:sameAs链接作为真实标签,从DBpedia与Wikidata中提取模糊实体,构建两个大规模数据集。
  • 使用RDF2Vec为两个知识图谱中的实体生成低维、上下文感知的嵌入,以捕捉结构与语义信息。
  • 将实体匹配建模为二分类问题:给定一个图中的查询实体,预测另一个图中每个候选实体是否为其正确匹配。
  • 在查询实体与候选实体嵌入的拼接表示上训练多层感知机(MLP),以学习匹配决策。
  • 采用70/10/20的训练/验证/测试集划分,并进行洗牌,以确保评估的稳健性,重点关注具有多个候选的模糊案例。
  • 使用平均倒数排名(MRR)评估性能,并对训练数据量与候选集大小进行消融研究。

实验结果

研究问题

  • RQ1在RDF2Vec嵌入上使用简单MLP能否在DBpedia与Wikidata之间模糊实体的匹配中实现高准确率?
  • RQ2在该实体匹配任务中,需要多少标注训练数据才能实现优异性能?
  • RQ3候选集大小如何影响模型对正确匹配进行正确排序的能力?
  • RQ4为何线性模型(如逻辑回归)在使用相同图嵌入时表现不佳,而与非线性MLP相比?
  • RQ5图嵌入在多大程度上能够独立捕捉跨知识图谱对齐所需的语义与结构上下文?

主要发现

  • MLP模型在DBpedia到Wikidata的完整训练集上达到MRR 0.85,在Wikidata到DBpedia上达到MRR 0.81,表明在模糊实体匹配任务上表现强劲。
  • 仅使用0.5%的训练数据,模型在两项任务上的MRR分别达到0.82与0.77,表明在极小监督下仍可实现高准确率。
  • 模型在歧义性较高的类型上表现最差,如Album与MusicalWork,其平均候选集大小分别为12.1与11.0,而人物类别的平均值为6.5。
  • 在正确实体排名第二的情况下,79.5%的失败案例涉及相同类型的候选,表明在相同领域内进行细粒度消歧存在困难。
  • 随着候选集大小的增加,MRR下降,证实歧义性与更大的候选池显著降低匹配准确率。
  • 在相同RDF2Vec嵌入上,逻辑回归表现不佳,凸显了非线性建模在捕捉嵌入空间中复杂关系方面的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。