[論文レビュー] Which Knowledge Graph Is Best for Me?
本論文は、特定のデータ品質要件に基づいて、DBpedia、Freebase、OpenCyc、Wikidata、YAGO の中から最も適した知識グラフを選択するための簡略化された意思決定ルールを提供する。11のデータ品質次元(正確性、完全性、タイムリー性、相互運用性など)にわたり、これらのKGを包括的に評価した詳細なサーベイに基づくもので、特定の用途に最適な選択肢を素早く特定するための軽量ガイドを提供する。
In recent years, DBpedia, Freebase, OpenCyc, Wikidata, and YAGO have been published as noteworthy large, cross-domain, and freely available knowledge graphs. Although extensively in use, these knowledge graphs are hard to compare against each other in a given setting. Thus, it is a challenge for researchers and developers to pick the best knowledge graph for their individual needs. In our recent survey, we devised and applied data quality criteria to the above-mentioned knowledge graphs. Furthermore, we proposed a framework for finding the most suitable knowledge graph for a given setting. With this paper we intend to ease the access to our in-depth survey by presenting simplified rules that map individual data quality requirements to specific knowledge graphs. However, this paper does not intend to replace our previously introduced decision-support framework. For an informed decision on which KG is best for you we still refer to our in-depth survey.
研究の動機と目的
- 特定のアプリケーションに最適な知識グラフを、主な公開利用可能なKGの中から選択するという課題に対処すること。
- 複雑なデータ品質評価を、実用的・即効性のあるルール of thumb の形に要約し、実務的応用を可能にすること。
- 個々のデータ品質要件を特定のKGにマッピングすることで、開発者や研究者が情報に基づいた意思決定を下せるように支援すること。
- 元のサーベイの厳密さを保ちながら、完全な推奨フレームワークの代替としての軽量な代替案を提供すること。
- 2018年に実施されたDBpedia、Freebase、OpenCyc、Wikidata、YAGOに関する包括的サーベイのデータ品質の発見を、より広くアクセス可能にする。
提案手法
- 知識グラフを体系的に評価するための11のデータ品質次元(正確性、完全性、タイムリー性、相互運用性など)を策定した。
- 各データ品質基準を測定可能なデータ品質メトリクスとして形式化し、定量的比較を可能にした。
- 5つのKGの2016年版の主要統計(トリプル数、エンティティ数、クラス数、関係数、リテラル数、URI数)を分析に活用した。
- サーベイの結果に基づき、「要件Yを満たす場合はKG Xを選択」という形の簡略化された意思決定ルールを策定した。
- 元のサーベイ(Färber et al., 2018)に含まれる完全な推奨フレームワーク(重み付き基準、事前選定、定量的スコアリング、定性的検証)を保持した。
- 4段階のフレームワークを提供した:(1) 重み付き基準による要件分析、(2) 事前選定、(3) メトリクスを用いた定量的評価、(4) 上位候補の定性的検証。
実験結果
リサーチクエスチョン
- RQ1DBpedia、Freebase、OpenCyc、Wikidata、YAGO の中で、正確性、完全性、タイムリー性といった特定のデータ品質要件を満たす知識グラフはどれか?
- RQ2信頼性、一貫性、相互運用性といったデータ品質次元を、大規模な知識グラフ間で体系的に測定・比較する方法は何か?
- RQ32016年時点における5つの主要なオープン知識グラフの構造的特徴、サイズ、データ表現の主な相違点は何か?
- RQ4正確性を損なわせることなく、複雑なデータ品質評価フレームワークから簡略化された意思決定プロセスを導き出す方法は何か?
- RQ5コミュニティ編集、マルチリンガルラベル、時間的有効性を必要とするタスクにおいて、Wikidata が OpenCyc よりも適しているような状況はどのようなものか?
主な発見
- Freebase が最も多くのトリプル(31.2億)を有しており、次いで Wikidata(7.48億)、DBpedia(4.12億)、YAGO(10.0億)、OpenCyc(2.4万)であった。
- Wikidata は最大のユニークな主語数(1.423億)とインスタンス数(1.422億)を有しており、広範なエンティティカバレッジを示している。
- YAGO は最も多くのクラス数(569,751)と関係数(106)を有しており、非常に構造化されたスキーマであることが示された。
- Wikidata は数百の言語でマルチリンガルラベルをサポートしていたが、OpenCyc や YAGO は記述的URIとWordNet統合を重視していた。
- Freebase と Wikidata は、それぞれ784,977および4,839のユニークな述語数を有しており、豊富な関係モデリングを示している。
- Wikidata と YAGO は、発表の時間的有効性とコミュニティ主導の修正をサポートしていたが、OpenCyc と DBpedia はこのような機能を欠いていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。