Skip to main content
QUICK REVIEW

[論文レビュー] On the Evaluation of RDF Distribution Algorithms Implemented over Apache Spark

Olivier Curé, Hubert Naacke|arXiv (Cornell University)|Jul 8, 2015
Advanced Database Systems and Queries参考文献 23被引用数 8
ひとこと要約

この論文では、Apache Spark上で実装された5つのRDF分散アルゴリズム—2つのハッシュベース、2つのグラフ分割、1つのハイブリッド—を評価し、データ準備コスト、負荷分散、リプリケーション、クエリパフォーマンスを検証した。結果として、ハッシュベース手法は低コストの準備と優れたスケーラビリティを示した一方、ハイブリッド手法は最小限のリプリケーションコストでほぼ最適に近いクエリパフォーマンスを達成し、既知のワークロードを持つデータウェアハウスに最適であることが示された。

ABSTRACT

Querying very large RDF data sets in an efficient manner requires a sophisticated distribution strategy. Several innovative solutions have recently been proposed for optimizing data distribution with predefined query workloads. This paper presents an in-depth analysis and experimental comparison of five representative and complementary distribution approaches. For achieving fair experimental results, we are using Apache Spark as a common parallel computing framework by rewriting the concerned algorithms using the Spark API. Spark provides guarantees in terms of fault tolerance, high availability and scalability which are essential in such systems. Our different implementations aim to highlight the fundamental implementation-independent characteristics of each approach in terms of data preparation, load balancing, data replication and to some extent to query answering cost and performance. The presented measures are obtained by testing each system on one synthetic and one real-world data set over query workloads with differing characteristics and different partitioning constraints.

研究の動機と目的

  • 統合的かつスケーラブルなフレームワーク内で、代表的なRDF分散戦略を評価・比較すること。
  • 異なる分散手法におけるデータ準備コスト、負荷分散、リプリケーション、クエリパフォーマンスの影響を評価すること。
  • Apache Sparkが分散RDF処理のための高性能プラットフォームとして実現可能であることを示すこと。
  • さまざまなクエリワークロードを持つ大規模RDFデータセットに対する最適な戦略を特定すること。
  • 実世界および合成ワークロードにおける、純粋なハッシング、グラフ分割、ハイブリッド手法の間のトレードオフを評価すること。

提案手法

  • Apache SparkのAPIを用いて、5つのRDF分散アルゴリズム(2つのハッシュベース、2つのグラフ分割(nHopDB、WARP)、1つのハイブリッド)を再実装した。
  • Sparkのインメモリ処理を活用して、Hadoop MapReduceよりもパフォーマンスを向上させ、フェイルセーフ性とスケーラビリティを確保した。
  • 1つの合成データセットと1つの実世界RDFデータセットを用い、異なるパーティショニング制約下で6つの多様なSPARQLクエリを評価した。
  • データ準備時間、負荷分散、リプリケーション率、クエリ実行時間を測定し、システムの挙動を比較した。
  • グラフ分割手法において、RSG(ルート付き部分グラフ)のグループ化にK-meansクラスタリングを適用したが、高次元ベクトル処理における制限が生じた。
  • Sparkのネイティブなクエリリライトおよび実行機能(Scalaで実装)を活用し、エンドツーエンドの処理パイプラインを簡素化した。

実験結果

リサーチクエスチョン

  • RQ1Apache Spark上で実装された場合、異なるRDF分散戦略は、データ準備コスト、負荷分散、リプリケーションの観点でどのように性能を発揮するか?
  • RQ2ハッシュベース手法とグラフ分割手法の間で、クエリパフォーマンスとシステムオーバーヘッドのトレードオフはどのようなものか?
  • RQ3ハッシングとnホップリプリケーションを組み合わせたハイブリッド分散戦略は、最小限の準備コストでより高いパフォーマンスを達成できるか?
  • RQ4Apache Sparkは、大規模RDFデータの分散とクエリ処理において、Hadoop MapReduceと比較してどの程度優れているか?
  • RQ5クエリの特性(例:スターパatters、プロパティチェーン)は、分散RDFシステムのパフォーマンスにどの程度影響を及えるか?

主な発見

  • ハッシュベース分散は、複雑な前処理を要せず、トリプルのロードのみで済むため、最小のデータ準備コストを達成した。
  • ハイブリッド手法は、nホップリプリケーションの利点と最小限の準備オーバーヘッドを組み合わせ、高価なグラフ分割の必要性を低減した。
  • ハイブリッドソリューションにおけるリプリケーションオーバーヘッドは、純粋なWARPと比較してわずかであったが、複雑なパターンのクエリパフォーマンスを顕著に向上させた。
  • Apache Sparkは優れたスケーラビリティを示し、クラスターノードの追加によって数十億トリプルを効率的に処理でき、一部の操作ではHadoop MapReduceを最大100倍の速度で上回った。
  • nHopDBやWARPのようなグラフ分割手法は、高次元ベクトル処理の制限とMetis依存による制限から、5億トリプルを超えるとスケーラビリティに限界が生じた。
  • クエリパターンの種類によってパフォーマンスは顕著に変動した:O-O結合は高いパーティション間通信を引き起こしたが、S-OおよびS-S結合はハッシュベース方式でより効率的だった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。