Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Speed Up Query Planning in Graph Databases

Mohammad Hossein Namaki, F A Rezaur Rahman Chowdhury|arXiv (Cornell University)|Jan 21, 2018
Graph Theory and Algorithms被引用数 5
ひとこと要約

本論文は、模倣学習を用いて貪欲な探索方策を学習することで、グラフデータベースにおけるクエリプランニングの高速化を図る学習による計画(L2P)フレームワークを提案する。DBpedia、YAGO、Freebaseの知識グラフにおいて、STARクエリリasonerの処理速度を顕著に向上させつつ、精度の損失を最小限に抑える。

ABSTRACT

Querying graph structured data is a fundamental operation that enables important applications including knowledge graph search, social network analysis, and cyber-network security. However, the growing size of real-world data graphs poses severe challenges for graph databases to meet the response-time requirements of the applications. Planning the computational steps of query processing - Query Planning - is central to address these challenges. In this paper, we study the problem of learning to speedup query planning in graph databases towards the goal of improving the computational-efficiency of query processing via training queries.We present a Learning to Plan (L2P) framework that is applicable to a large class of query reasoners that follow the Threshold Algorithm (TA) approach. First, we define a generic search space over candidate query plans, and identify target search trajectories (query plans) corresponding to the training queries by performing an expensive search. Subsequently, we learn greedy search control knowledge to imitate the search behavior of the target query plans. We provide a concrete instantiation of our L2P framework for STAR, a state-of-the-art graph query reasoner. Our experiments on benchmark knowledge graphs including DBpedia, YAGO, and Freebase show that using the query plans generated by the learned search control knowledge, we can significantly improve the speed of STAR with negligible loss in accuracy.

研究の動機と目的

  • 大規模なグラフデータベースのクエリにおいて、非効率なクエリプランニングによる応答遅延の課題に対処すること。
  • トレーニングクエリから学習することで、グラフデータベースにおけるクエリ処理の計算効率を向上させること。
  • しきい値アルゴリズム(TA)フレームワークの限界、例えば過剰に慎重な上限見積もりや固定された方策を克服すること。
  • TAベースのクエリリasonerの広範なクラスに適用可能な汎用的なフレームワークを開発すること。
  • 学習された探索制御方策を通じて、高い精度を維持しつつクエリ処理の大幅な高速化を達成すること。

提案手法

  • TAベースのプランを貪欲な探索経路として扱う、一般化可能なクエリプラン候補の探索空間を定義する。
  • 最適なターゲットクエリプランをトレーニングクエリ用に特定するため、高価なヒューリスティック駆動のビームサーチを実行する。
  • これらのターゲット経路の挙動を模倣する貪欲な方策を、模倣学習を用いて訓練する。
  • 一般化可能な特徴を用いて、探索状態から行動への関数として方策を定式化する。
  • STAR、最先端のグラフクエリリasonerを対象としてL2Pフレームワークを具体化し、エンドツーエンドの学習と推論を可能にする。
  • 未知のクエリおよびデータグラフ上で学習済み方策を評価し、一般化性と頑健性を評価する。

実験結果

リサーチクエスチョン

  • RQ1学習ベースの探索制御は、グラフデータベースにおけるクエリプランニングの計算効率を向上させ得るか?
  • RQ2学習済み方策は、異なる知識グラフやクエリ分布にわたってどれほど一般化できるか?
  • RQ3データグラフの進化が、学習済みクエリプランニング方策の安定性と性能に与える影響は何か?
  • RQ4ベースラインのTAベースのプランナーよりも顕著な高速化を達成しつつ、学習済み方策がどれほど高い精度を維持できるか?
  • RQ5再訓練を完全から行わずに、新しいデータグラフにフレームワークを効果的に転送できるか?

主な発見

  • L2P-STARは、Freebaseにおいて最大55.84倍の高速化を達成し、元のSTARと比較して精度はわずか0.96%低下した。
  • DBpediaでは、47.71倍の高速化と96%の精度を達成し、大規模知識グラフにおいて優れた性能を示した。
  • 転移学習の結果、あるデータセットで学習した方策が他のデータセットにもある程度一般化されたが、特に同じデータセットで学習・テストした場合に最高の精度を達成した。
  • 統合データセットで学習した方策は、Freebaseで最高の性能を発揮した。これは、異なるデータセット間での知識転送の可能性を示している。
  • データグラフの10%の変更(フォレストファイアサンプリングによる)に対しても、L2P-STARは93%以上の精度を維持し、さらに高速化を達成した。これは、データ進化に対して頑健であることを示している。
  • より大規模で密なグラフにおいて、高速化が向上した。これは、本手法が大規模かつ進化するデータ環境において特に有益であることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。