Skip to main content
QUICK REVIEW

[論文レビュー] Path Sampling: A Fast and Provable Method for Estimating 4-Vertex Subgraph Counts

Madhav Jha, C. Seshadhri|arXiv (Cornell University)|Nov 18, 2014
Complex Network Analysis Techniques参考文献 30被引用数 17
ひとこと要約

この論文は、3パスサンプリングと分散低減のためのプルーニングを用いる、新たな証明可能に正確なアルゴリズムであるパスサンプリングを紹介する。この手法は、3億エッジを持つ巨大グラフにおいても、6つの連結な4頂点部分グラフのカウントを推定可能であり、正確な列挙や従来のサンプリング手法と比べて数個のオーダー以上に高速でありながら、多様な実世界のネットワークにおいて相対誤差1%未満を維持する。

ABSTRACT

Counting the frequency of small subgraphs is a fundamental technique in network analysis across various domains, most notably in bioinformatics and social networks. The special case of triangle counting has received much attention. Getting results for 4-vertex patterns is highly challenging, and there are few practical results known that can scale to massive sizes. Indeed, even a highly tuned enumeration code takes more than a day on a graph with millions of edges. Most previous work that runs for truly massive graphs employ clusters and massive parallelization. We provide a sampling algorithm that provably and accurately approximates the frequencies of all 4-vertex pattern subgraphs. Our algorithm is based on a novel technique of 3-path sampling and a special pruning scheme to decrease the variance in estimates. We provide theoretical proofs for the accuracy of our algorithm, and give formal bounds for the error and confidence of our estimates. We perform a detailed empirical study and show that our algorithm provides estimates within 1% relative error for all subpatterns (over a large class of test graphs), while being orders of magnitude faster than enumeration and other sampling based algorithms. Our algorithm takes less than a minute (on a single commodity machine) to process an Orkut social network with 300 million edges.

研究の動機と目的

  • 巨大な実世界のグラフにおけるすべての連結な4頂点部分グラフカウントを、スケーラブルで正確に推定するための手法の不足に対処する。
  • 数百万エッジを持つグラフでは正確な列挙が非現実的になる組み合わせ的爆発を克服する。
  • すべての4頂点モチーフについて、数学的に証明可能な誤差境界と信頼区間を備えた、サンプリングベースの手法を提供する。
  • クラスターレベルの並列処理を必要とせず、1台のコンmodityマシン上で高い精度と高速性を達成する。
  • ソーシャルネットワークや生物学的ネットワークなどの大規模ネットワークにおける実用的なモチーフ解析を可能にする。4頂点パターンは、ネットワーク分類やモデリングにおいて有用な情報を提供する。

提案手法

  • 4頂点部分グラフの頻度を推定するために、長さ3のパスをサンプリングする3パスサンプリングフレームワークを提案する。
  • 重複するか低効用なパスサンプルを排除することで、推定の分散を低減する、新しいプルーニング方式を導入する。
  • 4頂点モチーフの構造的性質を活用し、サンプリングされた3パスを、既知の確率重み付きの特定のモチーフタイプにマッピングする。
  • 集中不等式を用いて、理論的誤差境界と信頼区間を保証する確率的アルゴリズムを用いる。
  • 完全な列挙や高コストなカラーコーディングを避けるために、パスベースの統計に焦点を当てたサンプリング戦略を設計する。
  • Map-Reduce や分散システムを必要とせず、1000万エッジを超えるグラフにスケーリング可能な、単一マシンで逐次実行可能なアルゴリズムを実装する。

実験結果

リサーチクエスチョン

  • RQ1サンプリングベースの手法は、巨大グラフにおいて、すべての6つの連結な4頂点部分グラフカウントを、証明可能に正確かつ低誤差で推定できるか?
  • RQ21台のマシン上で実行されるアルゴリズムは、4頂点モチーフカウントにおいて、従来のサンプリング手法や列挙手法を、速度と正確性の両面で上回ることができるか?
  • RQ3推定にバイアスを生じさせることなく、パスベースのサンプリングにおける分散を効果的に低減するプルーニング技術は何か?
  • RQ43パスサンプリングは、大規模な実世界のグラフにおいて、カラーコーディング、GRAFT、GUISEと比べて、実行時間と正確性の面でどのように異なるか?
  • RQ53億エッジを持つグラフにおいて、4頂点モチーフカウントを1分未塔で処理可能であり、相対誤差1%未塔を維持することは可能か?

主な発見

  • 3パスサンプリングアルゴリズムは、オルクート(3億エッジ)を含む多様な実世界のグラフにおいて、すべての4頂点モチーフカウントで相対誤差1%未塔を達成する。
  • オルクートグラフでは、1台のコンmodityマシン上で1分未塔で処理が完了するが、正確な列挙では1日以上を要する。
  • 100万エッジまでのグラフにおいて、カラーコーディングより100倍以上高速であり、GRAFT や GUISE よりも100〜1000倍高速である。
  • 列挙時間の5倍以上経過しても、GRAFT や GUISE は収束せず、相対誤差が50%を超える場合がある。
  • カラーコーディングは3パスサンプリングより高い正確性を示すが、100〜1000倍も遅いため、大規模解析においては3パスサンプリングがより優れたトレードオフを提供する。
  • プルーニング方式は分散を顕著に低減し、標準的なパスサンプリング手法と比較してはるかに少ないサンプル数で高精度な推定が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。