Skip to main content
QUICK REVIEW

[論文レビュー] SPARQL over GraphX.

Besat Kassaie|arXiv (Cornell University)|Jan 11, 2017
Graph Theory and Algorithms参考文献 14被引用数 5
ひとこと要約

本稿では、Apache Spark上のグラフ並列処理フレームワークであるGraphXを用いたSPARQLクエリ評価システムを提案する。このシステムは、GraphXモデル内での部分グラフマッチングを活用することで、大規模なRDFデータセットを効率的に処理する。従来のリレーショナルシステムと比較して高価なジョイン処理を回避し、大規模グラフにおいて優れたスケーラビリティを示している。

ABSTRACT

The ability of the RDF data model to link data from heterogeneous domains has led to an explosive growth of RDF data. So, evaluating SPARQL queries over large RDF data has been crucial for the semantic web community. However, due to the graph nature of RDF data, evaluating SPARQL queries in relational databases and common data-parallel systems needs a lot of joins and is inefficient. On the other hand, the enormity of datasets that are graph in nature such as social network data, has led the database community to develop graph-parallel processing systems to support iterative graph computations efficiently. In this work we take advantage of the graph representation of RDF data and exploit GraphX, a new graph processing system based on Spark. We propose a subgraph matching algorithm, compatible with the GraphX programming model to evaluate SPARQL queries. Some experiments are performed to show the system scalability to handle large datasets.

研究の動機と目的

  • 従来のリレーショナルデータベースを用いた場合、大規模なRDFデータセットにおけるSPARQLクエリの評価が非効率であるという問題に対処すること。
  • RDFデータの固有のグラフ構造を活用して、より効率的なクエリ処理を実現すること。
  • SparkのGraphXプログラミングモデルと互換性を持つ部分グラフマッチングアルゴリズムを設計すること。
  • 提案されたシステムの、大規模なRDFデータセットにおけるスケーラビリティとパフォーマンスを評価すること。

提案手法

  • GraphXのグラフ並列計算モデルを活用するため、RDFデータをプロパティグラフとして表現すること。
  • GraphXの頂点中心プログラミングモデルに適合した部分グラフマッチングアルゴリズムを設計すること。
  • SPARQL代数演算子を、頂点およびエッジのフィルタリングやパターンマッチングなどのグラフ操作にマッピングすること。
  • Sparkのメモリ内計算およびフェイルセーフ機能を活用して、クエリ処理のパフォーマンスを向上させること。
  • 複雑なSPARQLクエリ(パターンマッチングやバインディング伝搬を含む)の反復処理を実装すること。

実験結果

リサーチクエスチョン

  • RQ1GraphXは、大規模なRDFデータセットにおけるSPARQLクエリの評価に効果的に利用可能か?
  • RQ2提案されたGraphXベースのアプローチは、従来のリレーショナルデータベースシステムと比較して、SPARQL評価においてどの程度優れているか?
  • RQ3データセットサイズおよびクエリの複雑さの増加に伴い、システムのスケーラビリティはどの程度向上するか?

主な発見

  • 提案されたGraphXベースのSPARQL評価システムは、高価なジョイン処理を回避することで、従来のリレーショナルシステムよりも優れたパフォーマンスを達成している。
  • GraphXのメモリ内分散グラフ処理機能のおかげで、大規模なRDFデータセットにおいて強力なスケーラビリティを示している。
  • GraphXにおける部分グラフマッチングにより、反復的グラフ計算を通じて複雑なSPARQLクエリの効率的評価が可能になっている。
  • このアプローチはRDFデータのグラフ的性質を効果的に活用しており、リレーショナルモデルと比較してクエリ処理のオーバーヘッドを低減している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。