Skip to main content
QUICK REVIEW

[论文解读] A Linked Data Scalability Challenge: Concept Reuse Leads to Semantic Decay

Paolo Pareti, Ewan Klein|arXiv (Cornell University)|Mar 5, 2016
Semantic Web and Ontologies参考文献 10被引用 5
一句话总结

本文提出了一种针对链接数据概念的语义丰富度度量方法,用于量化每个概念可推断的事实数量,实证表明跨数据集的概念重用会降低语义丰富度。作者通过在十个数据集中对 foaf:Person 概念的验证,显示在合并数据集后语义丰富度显著下降,并建议通过创建子概念来保留语义丰富度,以应对典型实体的重用问题。

ABSTRACT

The increasing amount of available Linked Data resources is laying the foundations for more advanced Semantic Web applications. One of their main limitations, however, remains the general low level of data quality. In this paper we focus on a measure of quality which is negatively affected by the increase of the available resources. We propose a measure of semantic richness of Linked Data concepts and we demonstrate our hypothesis that the more a concept is reused, the less semantically rich it becomes. This is a significant scalability issue, as one of the core aspects of Linked Data is the propagation of semantic information on the Web by reusing common terms. We prove our hypothesis with respect to our measure of semantic richness and we validate our model empirically. Finally, we suggest possible future directions to address this scalability problem.

研究动机与目标

  • 为解决链接数据中因广泛的概念重用而导致语义质量下降的可扩展性挑战。
  • 定义一种语义丰富度度量方法,用于量化数据集中每个概念可推断的事实数量,且独立于分类结构。
  • 通过实证验证假设:合并数据集会降低常用概念的语义丰富度。
  • 提出一种通过识别并将典型实体分组为子概念来保留语义丰富度的方法。

提出的方法

  • 语义丰富度 Γ(α, S) 定义为从概念 α 和数据集 S 映射到一个正实数的函数,反映在 S 中关于 α 可推断的事实数量。
  • 该度量基于模式频率:匹配更频繁模式的实体对语义丰富度的贡献更大。
  • 为每个实体 ε 计算典型性得分 δε = |E ∩ Y| / |Y|,其中 Y 是概念 α 的频繁模式集合。
  • 典型性得分 δε < 0.5 的实体被视为非典型;其包含会降低语义丰富度。
  • 通过加权平均不等式对假设进行数学证明:Γ(α, S₁ ∪ S₂) ≤ (|S₁α|Γ(α, S₁) + |S₂α|Γ(α, S₂)) / (|S₁α| + |S₂α|)。
  • 提出一种通过自动模式分析识别典型实体并创建子概念以保留丰富度的策略。

实验结果

研究问题

  • RQ1在多个数据集中增加链接数据概念的重用是否会导致其语义丰富度的可测量下降?
  • RQ2能否定义一种独立于分类体系且适用于异构数据集的语义丰富度度量方法?
  • RQ3同一概念在不同数据集中的语义丰富度差异有多大?
  • RQ4基于模式频率的典型性得分能否预测实体包含对语义丰富度的影响?
  • RQ5基于实体典型性的子概念创建是否可行以保留语义丰富度?

主要发现

  • foaf:Person 概念的语义丰富度在不同数据集中差异显著,从 services.data.gov.uk 的 0.7 到 dbpedia.org 的 35.2 不等。
  • 实证结果表明,数据集合并会导致语义丰富度下降,验证了重用会降低语义价值的假设。
  • 两个数据集的合并结果的语义丰富度至多为各数据集的加权平均值,证实了理论不等式。
  • 当将高度结构化的 DBpedia 的 foaf:Person 与结构较松散的来源合并时,该概念的语义丰富度显著下降,表明可推断事实的损失。
  • 典型性得分 δε < 0.5 的实体被识别为非典型,其包含极有可能降低语义丰富度。
  • 本研究证明,通过典型实体创建子概念可在面对异构重用时有效保留语义丰富度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。