Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge Graphs on the Web -- an Overview

Nicolas Heist, Sven Hertling|arXiv (Cornell University)|Mar 2, 2020
Advanced Graph Neural Networks参考文献 42被引用数 38
ひとこと要約

本論文は公開されているクロスドメイン知識グラフを調査し、サイズ・内容・スキーマおよびグラフ間の重複を比較して、 explainable AI を含むアプリケーションのための KG 選択を導く。

ABSTRACT

Knowledge Graphs are an emerging form of knowledge representation. While Google coined the term Knowledge Graph first and promoted it as a means to improve their search results, they are used in many applications today. In a knowledge graph, entities in the real world and/or a business domain (e.g., people, places, or events) are represented as nodes, which are connected by edges representing the relations between those entities. While companies such as Google, Microsoft, and Facebook have their own, non-public knowledge graphs, there is also a larger body of publicly available knowledge graphs, such as DBpedia or Wikidata. In this chapter, we provide an overview and comparison of those publicly available knowledge graphs, and give insights into their contents, size, coverage, and overlap.

研究の動機と目的

  • 異種データを統合するための汎用的な知識表現として知識グラフの利用を動機づける。
  • DBpedia、Wikidata、YAGO、BabelNet、NELL、CaLiGraph、Voldemort など、公開されているクロスドメイン知識グラフの概要を示す。
  • 内容、規模、スキーマの複雑さ、および重複を特徴づけ、アプリケーション固有の KG 選択を支援する。
  • 作成技術(手動、構造化データ、非構造化データ)と、それらがカバレッジと品質に与える影響を論じる。

提案手法

  • 作成方法を手動的キュレーション、(半)構造化データ抽出、および非構造化データ抽出に分類する。
  • 代表的なパイプラインを説明する:Wikipediaの infobox を公理へマッピングする(DBpedia)、カテゴリ/WordNet ベースの型付け(YAGO)、多言語統合(Wikidata、BabelNet)、およびウェブデータからの抽出(CaLiGraph、VoldemortKG)。
  • KG 評価の一般的な指標を要約する(インスタンス、アサーション、リンク度、クラス、リレーション、オントロジーの深さ/幅、複雑さ)。
  • DBpedia、YAGO、Wikidata、BabelNet、NELL、CaLiGraph、Voldemort、Cyc などの公開知識グラフを用いた、サイズ、詳細、およびスキーマの複雑さの横断比較を提示する。
  • ヒューリスティックなリンク検出と再現率/適合率ベースの推定を用いて、KG間の相互リンクと重複の推定を説明する。

実験結果

リサーチクエスチョン

  • RQ1Web上の主要な公開クロスドメイン知識グラフは何で、それらはサイズ・内容・スキーマの点でどう異なるか。
  • RQ2作成方法(手動、構造化、非構造化)がこれらの知識グラフのカバレッジと品質にどのように影響するか。
  • RQ3主要な知識グラフ間の重複と相互リンクはどのようなもので、それらを組み合わせるとカバレッジがどのように改善される可能性があるか。
  • RQ4インスタンスレベルとスキーマレベルの指標をどう活用して、特定のアプリケーション(例: XAI)向けのKG選択を導くか。

主な発見

  • 知識グラフは、インスタンス数が数万から数千万、アサーション数が十万から十億と、規模の桁が異なる。
  • スキーマは深さと複雑さが異なり、DBpedia/NELL は小さなスキーマを持つ一方、Wikidata/BabelNet はより深く詳細な分類法を持つ。Cyc は正式オントロジーのため最も高い複雑さを示す。
  • 多くのクラスにおいて Wikidata が通常最も多くのインスタンスを持ち、YAGO はクラスレベル情報が最も詳細(高度に接続された情報)であることが多い。
  • KG間の相互リンクは一般的で、Wikidata、DBpedia、YAGO、CaLiGraph の間ではほぼ完了だが、NELL、OpenCyc、Voldemort では弱く、多重グラフ統合には相互リンク作業が必要であることを示している。
  • KG を組み合わせることでカバレッジが大幅に向上する可能性があり、特に BabelNet や CaLiGraph と DBpedia のような補完的ソース間で顕著だが、重複はクラスとソースによって異なる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。