Skip to main content
QUICK REVIEW

[論文レビュー] A Linked Data Scalability Challenge: Concept Reuse Leads to Semantic Decay

Paolo Pareti, Ewan Klein|arXiv (Cornell University)|Mar 5, 2016
Semantic Web and Ontologies参考文献 10被引用数 5
ひとこと要約

本稿では、リンクドデータのコンセププトにおける意味的豊かさの尺度を提案し、各コンセプトあたりの推論可能な事実の数を定量化する。実証的に、データセット間でのコンセプト再利用が意味的豊かさを低下させることを示し、一般的なエンティティに対して部分的コンセプトの作成により豊かさを維持する手法を提案する。

ABSTRACT

The increasing amount of available Linked Data resources is laying the foundations for more advanced Semantic Web applications. One of their main limitations, however, remains the general low level of data quality. In this paper we focus on a measure of quality which is negatively affected by the increase of the available resources. We propose a measure of semantic richness of Linked Data concepts and we demonstrate our hypothesis that the more a concept is reused, the less semantically rich it becomes. This is a significant scalability issue, as one of the core aspects of Linked Data is the propagation of semantic information on the Web by reusing common terms. We prove our hypothesis with respect to our measure of semantic richness and we validate our model empirically. Finally, we suggest possible future directions to address this scalability problem.

研究の動機と目的

  • リンクドデータにおけるスケーラビリティの課題に取り組み、広範なコンセプト再利用が意味的品質を低下させることを防ぐ。
  • 分類体系の構造に依存せず、データセット内でのコンセプトあたりの推論可能な事実の数を定量化する意味的豊かさの尺度を定義する。
  • 複数のデータセットを統合すると、一般的に再利用されるコンセプトの意味的豊かさが低下するという仮説を、実証的に検証する。
  • 典型的なエンティティを特定し、それらを部分的コンセプトにグループ化することで、意味的豊かさを維持する手法を提案する。

提案手法

  • 意味的豊かさ Γ(α, S) は、コンセプト α とデータセット S を正の実数にマッピングする関数として定義され、S 内での α に関する推論可能な事実を反映する。
  • この尺度はパターン頻度に基づく:より頻繁に出現するパターンに一致するエンティティが、意味的豊かさにより多く寄与する。
  • 各エンティティ ε について、典型的性スコア δε = |E ∩ Y| / |Y| を計算する。ここで Y はコンセプト α の頻出パターンの集合である。
  • δε < 0.5 であるエンティティは非典型的とみなされ、それらの含むことは意味的豊かさを低下させる。
  • 加重平均不等式を用いて仮説を数学的に証明する:Γ(α, S₁ ∪ S₂) ≤ (|S₁α|Γ(α, S₁) + |S₂α|Γ(α, S₂)) / (|S₁α| + |S₂α|)。
  • 自動パターン分析を用いて、典型的なエンティティから部分的コンセプトを作成する戦略を提案する。

実験結果

リサーチクエスチョン

  • RQ1複数のデータセットにまたがるリンクドデータコンセプトの再利用が、測定可能な意味的豊かさの低下を引き起こすか?
  • RQ2分類体系に依存せず、異種のデータセットに適用可能な意味的豊かさの尺度を定義できるか?
  • RQ3同じコンセプトの意味的豊かさは、異なるデータセット間でどの程度変動するか?
  • RQ4パターン頻度に基づく典型的性スコアは、エンティティの含めが意味的豊かさに与える影響を予測できるか?
  • RQ5エンティティの典型性に基づく部分的コンセプトの作成は、意味的豊かさの維持に実用的か?

主な発見

  • foaf:Person コンセプトの意味的豊かさは、データセットによって顕著に異なる。サービスデータ.gov.uk では 0.7 から、dbpedia.org では 35.2 まで変動する。
  • 実証的結果から、データセットを統合すると意味的豊かさが低下することが示され、再利用が意味的価値を低下させることを検証した。
  • 2つのデータセットを統合すると、意味的豊かさは、個々のデータセットの加重平均以下に抑えられ、理論的不等式を確認した。
  • 意味的に豊かさが著しく低下する。DBpedia の構造化された foaf:Person と、構造が不完全なソースを統合すると、推論可能な事実が失われる。
  • 典型的性スコア δε < 0.5 であるエンティティは非典型的と特定され、それらの含めが意味的豊かさを低下させる可能性がある。
  • 本研究では、典型的なエンティティから部分的コンセプトを作成することで、異種の再利用に対しても意味的豊かさを維持できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。