Skip to main content
QUICK REVIEW

[論文レビュー] Parallel Delta-Stepping Algorithm for Shared Memory Architectures

M. Kranjčević, Daniele Palossi|arXiv (Cornell University)|Apr 7, 2016
Graph Theory and Algorithms参考文献 8被引用数 4
ひとこと要約

この論文は、有向および無向グラフにおける単一始点最短経路のための共有メモリ実装として、同期のオーバーヘッドを低減することを目的としたデルタステッピングアルゴリズムを提示する。マルチコアCPUおよびIntel Xeon Phiの両方で、少なくとも50%の並列効率を達成しており、シーケンシャルモードでのBoost Graph Libraryのダイクストラ法よりも、小径のグラフにおいて優れた性能を発揮する。

ABSTRACT

We present a shared memory implementation of a parallel algorithm, called delta-stepping, for solving the single source shortest path problem for directed and undirected graphs. In order to reduce synchronization costs we make some deviations from the algorithm and discuss the consequences. We study the behaviour of our implementation on small-world and scale-free graphs, and graphs arising from game maps. We collect performance data on multi-core CPUs and Intel Xeon Phi. When run in sequential mode, our implementation outperforms the implementation of Dijkstra's algorithm from Boost Graph Library on graphs with a small diameter. Both on the CPU and the co-processor we achieve an overall performance of at least 50% parallel efficiency.

研究の動機と目的

  • 単一始点最短経路計算のためのスケーラブルな共有メモリ並列実装としてのデルタステッピングアルゴリズムの開発。
  • 元のデルタステッピングアルゴリズムを変更することで、並列グラフ処理における同期コストを低減すること。
  • スモールワールド、スケールフリーやゲームマップグラフを含む多様なグラフタイプにおける性能評価。
  • 従来のマルチコアCPUおよびIntel Xeon Phiのようなアクセcelレータでも高い並列効率を達成すること。

提案手法

  • スレッド同期を最小限に抑えるための作業配分の再設計により、共有メモリ向けにデルタステッピングアルゴリズムを適合させる。
  • 仮想距離ごとに頂点を管理するためのバケットベースのアプローチを採用し、エッジの並列リラクゼーションを可能にする。
  • アトミック演算や同期ポイントへの依存を減らすためのアルゴリズム的変更を導入する。
  • C++を用いて実装し、共有メモリシステムにおけるタスク並列化にOpenMPを活用する。
  • 実世界および合成グラフワークロードを用いて、CPUおよびIntel Xeon Phiアーキテクチャにおける性能を評価する。
  • ベースライン効率を評価するために、シーケンシャルモードでのBoost Graph Libraryのダイクストラ実装と性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1スモールワールドおよびスケールフリーなグラフにおいて、共有メモリ型デルタステッピング実装は、シーケンシャルなダイクストラ法と比べてどのように性能を発揮するか?
  • RQ2アルゴリズム的変更が同期オーバーヘッドおよび並列効率に与える影響は何か?
  • RQ3この実装は、マルチコアCPUおよびIntel Xeon Phiの両方で高い並列効率を達成できるか?
  • RQ4提案された実装は、シーケンシャルモードにおいてBoost Graph Libraryのダイクストラ法と比べて、どのように性能を発揮するか?
  • RQ5アルゴリズムのスケーラビリティは、異なるグラフタイプおよびハードウェアプラットフォームにおいてどのように評価できるか?

主な発見

  • 小径のグラフにおいて、この実装のシーケンシャル版は、Boost Graph Libraryのダイクストラ法を上回る性能を発揮する。
  • マルチコアCPUおよびIntel Xeon Phiアーキテクチャの両方で、少なくとも50%の並列効率を達成する。
  • スモールワールド、スケールフリー、ゲームマップグラフを含む多様なグラフタイプにおいて、性能の向上が確認された。
  • アルゴリズム的変更により、同期コストが効果的に低減され、並列スケーラビリティが向上した。
  • 一般用途のCPUおよびXeon Phiのようなアクセcelレータハードウェアの両方で、優れた性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。