Skip to main content
QUICK REVIEW

[论文解读] Which Knowledge Graph Is Best for Me?

Michael Färber, Achim Rettinger|arXiv (Cornell University)|Sep 28, 2018
Data Quality and Management参考文献 4被引用 9
一句话总结

本文提供了简化的决策规则,帮助研究人员和开发者根据特定的数据质量需求选择最合适的知识图谱(DBpedia、Freebase、OpenCyc、Wikidata、YAGO)。该研究基于一项深入的调查,评估了这些知识图谱在11项数据质量维度(如准确性、完整性、及时性及互操作性)上的表现,提供了一套轻量级指南,可快速识别特定应用场景下的最佳匹配。

ABSTRACT

In recent years, DBpedia, Freebase, OpenCyc, Wikidata, and YAGO have been published as noteworthy large, cross-domain, and freely available knowledge graphs. Although extensively in use, these knowledge graphs are hard to compare against each other in a given setting. Thus, it is a challenge for researchers and developers to pick the best knowledge graph for their individual needs. In our recent survey, we devised and applied data quality criteria to the above-mentioned knowledge graphs. Furthermore, we proposed a framework for finding the most suitable knowledge graph for a given setting. With this paper we intend to ease the access to our in-depth survey by presenting simplified rules that map individual data quality requirements to specific knowledge graphs. However, this paper does not intend to replace our previously introduced decision-support framework. For an informed decision on which KG is best for you we still refer to our in-depth survey.

研究动机与目标

  • 为特定应用场景中从主要公开可用的知识图谱中选择最合适者提供解决方案。
  • 将复杂的数据质量评估结果提炼为可操作的、基于经验法则的推荐建议,以供实际应用。
  • 通过将个体数据质量需求映射到特定知识图谱,支持开发者和研究人员做出明智决策。
  • 在保留原始调查严谨性的同时,提供全推荐框架的轻量级替代方案。
  • 提升2018年对DBpedia、Freebase、OpenCyc、Wikidata和YAGO的全面调查中数据质量发现的可及性。

提出的方法

  • 制定了11项数据质量维度(如准确性、完整性、及时性、互操作性等),以系统化方式评估知识图谱。
  • 将每项数据质量标准形式化为可量化的数据质量指标,实现定量比较。
  • 使用2016年五个知识图谱的统计数据(三元组、实体、类、关系、字面量、URI)作为分析依据。
  • 基于调查结果,制定简化版决策规则,形式为“若满足需求Y,则选择知识图谱X”。
  • 保留了原始调查中的完整推荐框架(Färber et al., 2018),该框架包含加权标准、预选、定量评分和定性验证。
  • 提供四步框架:(1) 带加权标准的需求分析,(2) 预选,(3) 通过指标进行定量评估,(4) 对候选者进行定性验证。

实验结果

研究问题

  • RQ1在DBpedia、Freebase、OpenCyc、Wikidata和YAGO中,哪一个知识图谱最能满足特定的数据质量需求,如准确性、完整性或及时性?
  • RQ2如何系统性地测量和比较大规模知识图谱之间的数据质量维度(如可信度、一致性及互操作性)?
  • RQ3截至2016年,五大主流开放知识图谱在结构、规模和数据表示方面的主要差异是什么?
  • RQ4如何从复杂的数据质量评估框架中推导出简化的决策流程,同时不牺牲准确性?
  • RQ5在需要社区编辑、多语言标签或时间有效性支持的任务中,何种条件下一个知识图谱(如Wikidata)比另一个(如OpenCyc)更合适?

主要发现

  • Freebase拥有最多的三元组(31.2亿个),其次是Wikidata(7.48亿个)、DBpedia(4.12亿个)、YAGO(10.0亿个)和OpenCyc(240万个)。
  • Wikidata拥有最多的唯一主体(1.423亿个)和唯一实例(1.422亿个),表明其具备广泛的实体覆盖范围。
  • YAGO拥有最多的类(569,751个)和关系(106个),表明其具有高度结构化的模式。
  • Wikidata支持数百种语言的多语言标签,而OpenCyc和YAGO则强调描述性URI及WordNet集成。
  • Freebase和Wikidata拥有最多的唯一谓词(分别为784,977个和4,839个),反映出其丰富的关系建模能力。
  • Wikidata和YAGO支持陈述的时间有效性及社区驱动的修正功能,而OpenCyc和DBpedia缺乏此类特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。