Skip to main content
QUICK REVIEW

[論文レビュー] Enumerating Subgraph Instances Using Map-Reduce

Foto Afrati, Dimitris Fotakis|arXiv (Cornell University)|Aug 2, 2012
Graph Theory and Algorithms参考文献 19被引用数 6
ひとこと要約

この論文は、大規模なデータグラフにおける任意のサンプルグラフのすべてのインスタンスを、通信コストと計算コストの両方を最小限に抑えて、1ラウンドのMap-Reduceフレームワークで効率的に列挙する手法を提示する。最適な多方向ジョイン技術と結合的クエリ分解を活用することで、通信最適化を達成し、次数が有界なグラフにおいて、計算量の点で直列アルゴリズムと同等の性能を示す、証明可能に変換可能なアルゴリズムを実現する。

ABSTRACT

The theme of this paper is how to find all instances of a given "sample" graph in a larger "data graph," using a single round of map-reduce. For the simplest sample graph, the triangle, we improve upon the best known such algorithm. We then examine the general case, considering both the communication cost between mappers and reducers and the total computation cost at the reducers. To minimize communication cost, we exploit the techniques of (Afrati and Ullman, TKDE 2011)for computing multiway joins (evaluating conjunctive queries) in a single map-reduce round. Several methods are shown for translating sample graphs into a union of conjunctive queries with as few queries as possible. We also address the matter of optimizing computation cost. Many serial algorithms are shown to be "convertible," in the sense that it is possible to partition the data graph, explore each partition in a separate reducer, and have the total computation cost at the reducers be of the same order as the computation cost of the serial algorithm.

研究の動機と目的

  • 与えられたサンプルグラフのすべてのインスタンスを、大規模なデータグラフにおいてスケーラブルかつ1ラウンドのMap-Reduceで列挙するためのアルゴリズムを設計すること。
  • 結合的クエリのための最適な多方向ジョイン技術を活用して、マッパーとリデューサ間の通信コストを最小限に抑えること。
  • リデューサでの合計計算コストが、最良の直列アルゴリズムの計算量と一致することを保証し、「変換可能性」を達成すること。
  • 特にノード次数が√mで有界である場合に、次数制約下での性能を分析すること。
  • フレームワークをラベル付きおよび有向グラフに拡張し、Map-Reduceにおける効率的並列化の限界を検討すること。

提案手法

  • サンプルグラフを、クエリ数を最小限に抑えて通信オーバーヘッドを低減するため、結合的クエリ(CQ)の和に変換する。
  • キーのハッシュ戦略を用いてエッジをリデューサに分散配置し、必要なサブグラフコンポONENTがすべて同じ場所に配置されるようにすることで、データ転送を最小限に抑える。
  • 通信コストを低減するために、[2]で示された最適な多方向ジョイン評価手法を1ラウンドのMap-Reduceで適用する。
  • 計算効率を確保するため、データグラフをパーティションに分割し、各パーティションを別々のリデューサに割り当てる。これにより、元の直列アルゴリズムの作業量の複雑さが保持される。
  • 条件に基づく最適化を導入:中間関係のサイズに特定の制約が満たされた場合、より低い計算量の実行パスに切り替える。
  • ラベル付きおよび有向グラフを関係の集合として表現し、サブグラフインスタンスをCQの和として表現することで、これらのグラフタイプに対しても対応する。

実験結果

リサーチクエスチョン

  • RQ1任意のサンプルグラフのすべてのインスタンスを、通信コストが理論的最下界に近い1ラウンドのMap-Reduceで列挙できるか?
  • RQ2サンプルグラフを表現するための結合的クエリの数を最小限に抑えるにはどうすればよいか?これにより通信および計算コストを低減できるか?
  • RQ3どのような条件下で、直列サブグラフ列挙アルゴリズムを、合計計算コストが同等の並列Map-Reduceアルゴリズムに変換できるか?
  • RQ4データグラフのノード次数を√mに制限することで、通信コストおよび計算コストがより低い、証明可能に変換可能なアルゴリズムが得られるか?
  • RQ5効率性と正しさを維持したまま、このフレームワークをラベル付きまたは有向グラフにどの程度まで拡張できるか?

主な発見

  • 提案されたアルゴリズムは、多方向ジョイン評価の理論的下界と等しい通信コストを達成し、通信面で最適である。
  • ノード次数が√mで有界なデータグラフにおいて、サブグラフ出現回数の既知の下界と一致する、改善された変換可能なアルゴリズムを提示している。
  • フレームワークは、リデューサでの合計計算コストが、知られている最良の直列アルゴリズムと同程度のオーダーとなることを保証し、「変換可能性」を達成している。
  • クエリ計画における中間関係のサイズが特定の不等式(例:n₁n₅n₃ ≤ n₂n₄)を満たす場合、計算量がn₁n₅n₃であるより低い計算量の実行パスに切り替わり、この場合のコストは上界としても下界としても成立する。
  • ラベル付きおよび有向グラフに対しても、それらを結合的クエリの和として表現することで一般化され、同じコア最適化技術を用いて効率性が保持される。
  • 使用するリデューサの数は、異なるキーの数によって制限され、固定されたリデューサ数のもとで、リデューサ数を最小限に抑えると通信コストが低下することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。