Skip to main content
QUICK REVIEW

[論文レビュー] Keyword Search on RDF Graphs - A Query Graph Assembly Approach

Shuo Han, Lei Zou|arXiv (Cornell University)|Apr 1, 2017
Semantic Web and Ontologies参考文献 39被引用数 6
ひとこと要約

本稿では、RDFグラフ上のキーワード検索のためのクエリグラフアセンブリ(QGA)手法を提案する。ユーザーの意図を、アンビグアエートされたエンティティ、クラス、述語から構成される構造的クエリグラフとしてモデル化する。QGAをNP完全問題として定式化し、ヒューリスティックな下界を用いた二部グラフマッチングに基づくベストファーストサーチを採用することで、RDFグラフのサイズに依存しない高い効率性とスケーラビリティを達成し、DBpediaおよびFreebaseにおいて、先行研究を上回る効果性と応答時間の両面で優れた性能を発揮する。

ABSTRACT

Keyword search provides ordinary users an easy-to-use interface for querying RDF data. Given the input keywords, in this paper, we study how to assemble a query graph that is to represent user's query intention accurately and efficiently. Based on the input keywords, we first obtain the elementary query graph building blocks, such as entity/class vertices and predicate edges. Then, we formally define the query graph assembly (QGA) problem. Unfortunately, we prove theoretically that QGA is a NP-complete problem. In order to solve that, we design some heuristic lower bounds and propose a bipartite graph matching-based best-first search algorithm. The algorithm's time complexity is $O(k^{2l} \cdot l^{3l})$, where $l$ is the number of the keywords and $k$ is a tunable parameter, i.e., the maximum number of candidate entity/class vertices and predicate edges allowed to match each keyword. Although QGA is intractable, both $l$ and $k$ are small in practice. Furthermore, the algorithm's time complexity does not depend on the RDF graph size, which guarantees the good scalability of our system in large RDF graphs. Experiments on DBpedia and Freebase confirm the superiority of our system on both effectiveness and efficiency.

研究の動機と目的

  • RDFグラフ上でのユーザーのキーワード検索を正確に解釈する課題に対処するため、クエリの意図を構造的クエリグラフとしてモデル化すること。
  • キーワードのアンビグアエーションとクエリ構造生成を統合的な最適化モデルに統合し、逐次処理による誤差伝播を回避すること。
  • RDFグラフのサイズに依存しない効率的かつスケーラブルなアルゴリズムを設計し、大規模な展開においても高速な応答時間を確保すること。
  • TransEベースのグラフ埋め込みを活用して、候補クエリグラフの意味的整合性を評価することで、検索の有効性を向上させること。

提案手法

  • キーワード検索を、各キーワードが候補となるエンティティ、クラス、述語にマッチングされるクエリグラフアセンブリ(QGA)問題として定式化する。
  • キーワードとクエリグラフ要素とのマッチングを表すために二部グラフモデルを構築し、アンビグアエーションと構造形成の両方を統合的に最適化可能にする。
  • 探索空間を削減するためのヒューリスティックな下界として、Naive-LB、Greedy-LB、KM-LBを導入し、ベストファーストサーチ戦略を採用する。
  • QGAアルゴリズムは、これらの下界に従ってガイドされるベストファーストサーチを用い、時間計算量はO(k²ˡ·l³ˡ)である。ここでlはキーワード数、kは1キーワードあたりの最大候補数を表す。
  • 候補クエリグラフの意味的整合性を評価するために、TransE埋め込みを用い、最適化の目的関数として活用する。
  • 二段階フレームワークを採用する:段階IではキーワードをRDFアイテムにマッピングし、候補クエリグラフを構築する。段階IIではQGAアルゴリズムを用いて最適なクエリグラフをアセンブルする。
Figure 1 . Related Work of Keyword Search Problem.
Figure 1 . Related Work of Keyword Search Problem.

実験結果

リサーチクエスチョン

  • RQ1キーワード検索を、アンビグアエーションと構造形成を統合的に処理する一貫したクエリグラフアセンブリ問題としてどのようにモデル化できるか?
  • RQ2NP完全問題であるQGA問題の探索空間を著しく削減しつつ、解の品質を損なわせない効果的なヒューリスティックな下界は何か?
  • RQ3大規模なRDFグラフ(数十億の三元組を含む)において、クエリグラフアセンブリプロセスをどのようにして効率的かつスケーラブルに実現できるか?
  • RQ4アンビグアエーションと構造形成を単一の最適化モデルに統合することで、逐次処理と比較して検索精度がどの程度向上するか?
  • RQ5パラメータk(候補制限)とN(検討対象とする上位クエリグラフ数)をチューニングする際の、応答時間と精度のトレードオフはどのようなものか?

主な発見

  • 本稿で提案するQGAアルゴリズムは、DBpediaでは平均734.9ms、Freebaseでは1103.2msの応答時間を達成し、QGAフェーズ自体は1クエリあたり80ms未塔である。
  • k=10およびN=5が、精度とパフォーマンスの最良のトレードオフを提供する。F1スコアはこれらの値を超えるとプラトーに達する。
  • Greedy-LBヒューリスティックは、プルーニング効果と効率性の両面で最良のバランスを示し、Naive-LBに比べて探索ステートを70%以上削減し、KM-LBよりも高速である。
  • QALD-6およびFree917の180件のベンチマーククエリにおいて、最先端手法DPBFおよびSUMGを平均1~3倍の性能で上回る。
  • TransEベースのスコアリングは、構造的情報を捉えないベースライン手法と比較して、F1スコアの比較により顕著な精度向上を示している。
  • QGAアルゴリズムの時間計算量はRDFグラフのサイズに依存しないため、DBpediaやFreebaseのような大規模知識グラフへの高いスケーラビリティを有する。
Figure 2 . A Sample of DBpedia RDF Graph.
Figure 2 . A Sample of DBpedia RDF Graph.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。