Skip to main content
QUICK REVIEW

[論文レビュー] MapSQ: A MapReduce-based Framework for SPARQL Queries on GPU

Jiaying Feng, Xiaowang Zhang|arXiv (Cornell University)|Feb 12, 2017
Semantic Web and Ontologies参考文献 4被引用数 6
ひとこと要約

MapSQ は、大規模な RDF データセットにおける効率的な SPARQL クエリ処理のための、GPU アクセラレートされた MapReduce ベースのフレームワークである。GPU の並列処理を活用した MapReduce スタイルの結合処理と、CPU-GPU コプロセッシングモデルを採用し、gStore や gStoreD といった CPU ベースのエンジンと比較して最大 50% の高速化を達成した。

ABSTRACT

In this paper, we present a MapReduce-based framework for evaluating SPARQL queries on GPU (named MapSQ) to large-scale RDF datesets efficiently by applying both high performance. Firstly, we develop a MapReduce-based Join algorithm to handle SPARQL queries in a parallel way. Secondly, we present a coprocessing strategy to manage the process of evaluating queries where CPU is used to assigns subqueries and GPU is used to compute the join of subqueries. Finally, we implement our proposed framework and evaluate our proposal by comparing with two popular and latest SPARQL query engines gStore and gStoreD on the LUBM benchmark. The experiments demonstrate that our proposal MapSQ is highly efficient and effective (up to 50% speedup).

研究の動機と目的

  • CPU 僅用アーキテクチャにおける大規模 SPARQL クエリ処理の性能ボトルネックを解消すること。
  • GPU の並列処理を活用して、SPARQL クエリ評価における計算集約的な結合処理を高速化すること。
  • CPU がクエリの分解を管理し、GPU が結果の結合処理を加速するハイブリッド CPU-GPU アーキテクチャを設計すること。
  • 現代の異種コンピューティングを活用して、大規模 RDF ワークロードにおける SPARQL クエリ処理の効率性とスケーラビリティを向上させること。

提案手法

  • GPU 上で MapReduce ベースの結合アルゴリズムを設計し、SPARQL 三項組の途中結果を並列処理する。
  • マップ段階でフラグベースのラベル付け(LEFT/RIGHT)を実施し、レッドース段階での重複削減を効率化する。
  • CPU がサブクエリをディスpatchし、GPU が GPU 最適化された MapReduce を用いて結合計算を実行するコプロセッシング戦略を実装する。
  • RDF ストレージと初期部分一致処理のために、バックエンドエンジンとして gStore および gStoreD とフレームワークを統合する。
  • 結合処理中のカルテシアン積の演算を加速するために、GPU の Single Instruction Multiple Data (SIMD) アーキテクチャを適用する。
  • フレームワークを二段階に構造化する:(1) CPU による三項組の部分一致処理、(2) GPU アクセラレートされた MapReduce 結合処理。

実験結果

リサーチクエスチョン

  • RQ1GPU アクセラレートされた MapReduce フレームワークは、大規模 RDF データセットにおける SPARQL クエリ評価の性能を顕著に向上させることができるか?
  • RQ2SPARQL エンジンにおける GPU ベースの MapReduce 結合処理の性能は、従来の CPU ベースの結合アルゴリズムと比べてどのように異なるか?
  • RQ3ハイブリッド CPU-GPU アーキテクチャは、複雑な SPARQL クエリにおけるエンドツーエンドのクエリ応答時間をどの程度短縮できるか?
  • RQ4提案されたフレームワークは、データセットサイズやクエリの複雑さの増加に伴って、効果的にスケーリングできるか?

主な発見

  • LUBM ベンチマークにおいて、MapSQ は gStore と比較して最大 50% の応答時間短縮を達成した。
  • クエリ Q4 において、応答時間は gStore の 635 ms から MapSQ では 339 ms に短縮され、46.6% の改善が得られた。
  • 5つのベンチマーククエリすべてにおいて、MapSQ は gStoreD を上回り、1.15× から 2.05× のスピードアップを達成した。
  • 中間結果セットが大きな複雑なクエリにおいて性能向上が顕著であり、GPU のスケーラビリティが顕著に効果を発揮した。
  • GPU 上で実装された MapReduce ベースの結合アルゴリズムは、gStore や gStoreD のネイティブな CPU ベースの結合処理よりも、結合処理時間をより効果的に短縮した。
  • コプロセッシングモデルにより、計算集約的な結合処理が効果的に GPU にオフロードされ、CPU のオーバーヘッドを最小限に抑え、スループットを最大化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。