[論文レビュー] Partitioning Strategies for Load Balancing Subgraph-centric Distributed Graph Processing
本稿では、スケールダウングラフ処理における負荷バランスを改善するために、フラット、階層的、適応的の3つのサブグラフ中心のパーティショニング戦略を提案する。マシン間でのコンponentの分配を最適化することで、デフォルト戦略と比較してCPU利用率を最大8倍に向上させ、マケスパンを最大5倍に短縮し、パワー則および空間平面グラフにおいてApache Giraphを上回るスケーラビリティと効率性を実現する。
Distributed graph processing platforms have helped emerging application domains use commodity clusters and Clouds to analyze large graphs. Vertex-centric programming models like Google Pregel, and their subgraph-centric variants, specify data-parallel application logic for a single vertex or component that execute iteratively. The locality and balancing of components within partitions affects the performance of such platforms. We propose three partitioning strategies for a subgraph-centric model, and analyze their impact on CPU utilization, communication, iterations, and makespan. We analyze these using Breadth First Search and PageRank algorithms on powerlaw and spatio-planar graphs. They are validated on a commodity cluster using our GoFFish subgraph-centric platform, and compared against Apache Giraph vertex-centric platform. Our experiments show upto 8 times improvement in utilization resulting to upto 5 times improvement of overall makespan for flat and hierarchical partitioning over the default strategy due to improved machine utilization. Further, these also exhibit better horizontal scalability relative to Giraph.
研究の動機と目的
- 不良な負荷バランスと通信オーバーヘッドによって引き起こされる分散グラフ処理におけるパフォーマンスボトルネックを解消すること。
- サブグラフ中心のグラフ処理プラットフォームにおけるCPU利用率の向上とマケスパンの短縮。
- コンmodityクラスタ上での水平スケーラビリティとリソース利用率を向上させるパーティショニング戦略の評価。
- 実世界のワークロードにおけるApache Giraphのような頂点中心モデルと比較して、サブグラフ中心のパーティショニングのスケーラビリティと効率性の向上を評価すること。
提案手法
- 頂点の次数と接続性に基づいてグラフをサブグラフに分割するフラットパーティショニングを提案し、各マシンの処理負荷をバランスさせる。
- 大きなサブグラフを再帰的に分割することで、負荷の偏りを低減し、負荷分布を改善する階層的パーティショニングを導入。
- 実行時のパフォーマンス指標に基づいてサブグラフを動的に再割り当てすることで、バランスを維持する適応的パーティショニングを設計。
- BFSやPageRankのような反復アルゴリズムを用いて、サブグラフ中心の実行を実装・評価するため、GoFFishプラットフォームを活用。
- 実世界のワークロードをシミュレートするため、パワー則および空間平面グラフを用い、CPU利用率、通信量、反復回数、マケスパンのパフォーマンスを測定。
- スケーラビリティと効率性の向上を評価するため、Apache Giraphの頂点中心モデルと比較して結果を分析。
実験結果
リサーチクエスチョン
- RQ1異なるサブグラフパーティショニング戦略は、分散グラフ処理におけるCPU利用率にどのように影響するか?
- RQ2提案されたパーティショニング戦略は、デフォルト戦略および頂点中心戦略と比較して、マケスパンをどの程度短縮できるか?
- RQ3提案されたパーティショニングは、コンmodityクラスタ上での水平スケーラビリティをどの程度向上させるか?
- RQ4パーティショニングは、反復的グラフアルゴリズムにおける通信量と反復回数にどのような影響を与えるか?
主な発見
- フラットおよび階層的パーティショニングは、デフォルト戦略と比較して、最大8倍のCPU利用率向上を達成した。
- 提案されたパーティショニング戦略を用いることで、マケスパンがデフォルトアプローチと比較して最大5倍短縮された。
- サブグラフ中心のアプローチは、テストされたすべてのグラフタイプにおいて、Apache Giraphよりも優れた水平スケーラビリティを示した。
- 幅優先探索(BFS)およびPageRankワークロードでは、負荷の不均衡と通信オーバーヘッドの低減により顕著なパフォーマンス向上が得られた。
- 適応的パーティショニングは実行中に高い負荷バランスを維持し、一貫したパフォーマンス向上を実現した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。