Skip to main content
QUICK REVIEW

[论文解读] Gollum: A Gold Standard for Large Scale Multi Source Knowledge Graph Matching

Sven Hertling, Heiko Paulheim|arXiv (Cornell University)|Sep 15, 2022
Semantic Web and Ontologies被引用 4
一句话总结

Gollum 为多源知识图谱匹配提供了一个大规模的黄金标准,涵盖从 DBpedia 提取的维基百科中衍生出的 4,149 个知识图谱,对应关系超过 275,000 个。它通过三种不同的划分方式支持对无监督和有监督匹配方法的评估,其中包括一个对传递闭包具有鲁棒性的测试集,并在置信度过滤子集上实现了高达 0.985 的精确率,表明其对齐质量优异。

ABSTRACT

The number of Knowledge Graphs (KGs) generated with automatic and manual approaches is constantly growing. For an integrated view and usage, an alignment between these KGs is necessary on the schema as well as instance level. While there are approaches that try to tackle this multi source knowledge graph matching problem, large gold standards are missing to evaluate their effectiveness and scalability. We close this gap by presenting Gollum -- a gold standard for large-scale multi source knowledge graph matching with over 275,000 correspondences between 4,149 different KGs. They originate from knowledge graphs derived by applying the DBpedia extraction framework to a large wiki farm. Three variations of the gold standard are made available: (1) a version with all correspondences for evaluating unsupervised matching approaches, and two versions for evaluating supervised matching: (2) one where each KG is contained both in the train and test set, and (3) one where each KG is exclusively contained in the train or the test set.

研究动机与目标

  • 为解决当前缺乏大规模、多源知识图谱匹配系统评估用黄金标准的问题。
  • 支持在多样化训练与测试划分下,对无监督和有监督匹配方法进行基准测试。
  • 支持在多源知识图谱集成场景中对可扩展性与有效性进行评估。
  • 提供一个高质量、可调节置信度的基准数据集,其源自真实世界中从 DBpedia 提取的知识图谱。
  • 通过提供具有受控数据泄露防护的训练集与测试集,促进未来多源匹配系统的发展。

提出的方法

  • 黄金标准基于通过 DBpedia 框架从大型维基农场提取的 4,149 个知识图谱构建。
  • 通过结合人工校对与基于相似度得分的置信度阈值,在实例、类和属性三个层面建立对应关系。
  • 发布数据集的三个版本:一个用于无监督评估,一个在训练集与测试集中包含重叠的知识图谱,一个采用互斥的知识图谱划分以防止传递闭包导致的数据泄露。
  • 采用分层聚合聚类(HAC)策略,基于文本内容的 TF-IDF 向量与 URI 片段,指导多源匹配中的渐进式合并过程。
  • 复用两种 1:1 匹配器——Alod2Vec 和基于字符串的匹配器——在多源策略中,通过置信度排序进行后处理,以强制实现 1:1 对齐。
  • 评估包含实例、类和属性匹配的精确率、召回率与 F1 分数,并应用置信度阈值以评估鲁棒性。

实验结果

研究问题

  • RQ1当通过迭代合并方式将现有 1:1 知识图谱匹配系统适配到多源匹配任务时,其有效性如何?
  • RQ2通过传递闭包导致的数据泄露对多源知识图谱匹配中测试集可靠性有何影响?
  • RQ3黄金标准在不同置信度阈值及不同匹配类型(实例、类、属性)下的质量表现如何变化?
  • RQ4有监督的训练划分是否能提升无监督匹配系统在多源环境下的性能?
  • RQ5在大规模多源集成场景中,不同匹配策略在可扩展性与性能之间的权衡关系如何?

主要发现

  • 黄金标准包含 275,103 个对应关系,分布在 4,149 个知识图谱中,通过置信度过滤验证了其高质量对齐。
  • 在最高置信度子集(conf=1.0)中,精确率达到 0.985,表明对齐质量极佳。
  • 基于字符串的匹配器在实例匹配中达到 0.959 的精确率与 0.795 的 F1 分数,优于 Alod2Vec 在此类别中的表现。
  • Alod2Vec 在类匹配中的精确率(0.842)高于基于字符串的匹配器(0.829),表明其在语义类对齐方面表现更优。
  • 召回率保持较低水平(如 Alod2Vec 在实例匹配中为 0.390),表明大量真实对应关系仍未被检测到,凸显仍有较大改进空间。
  • Alod2Vec 的运行时间显著更长(六天),远超基于字符串的匹配器(两天),主要由于基于嵌入的匹配计算开销较大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。