Skip to main content
QUICK REVIEW

[論文レビュー] HyperANF: Approximating the Neighbourhood Function of Very Large Graphs on a Budget

Paolo Boldi, Marco Rosa|arXiv (Cornell University)|Nov 25, 2010
Complex Network Analysis Techniques被引用数 12
ひとこと要約

HyperANFは、ハイパーログログカウンタとブロードワードプログラミングを用いて、巨大グラフの近傍関数を高スケーラビリティで近似するアルゴリズムを導入し、標準のワークステーションで数時間の計算時間で10億ノード規模のグラフにおいて有効直径と、新たな構造的指標であるspid(最短経路分散インデックス)を正確に計算可能にした。この指標は、ソーシャルネットワークとウェブグラフを信頼性高く区別できる。

ABSTRACT

The neighbourhood function N(t) of a graph G gives, for each t, the number of pairs of nodes <x, y> such that y is reachable from x in less that t hops. The neighbourhood function provides a wealth of information about the graph (e.g., it easily allows one to compute its diameter), but it is very expensive to compute it exactly. Recently, the ANF algorithm (approximate neighbourhood function) has been proposed with the purpose of approximating NG(t) on large graphs. We describe a breakthrough improvement over ANF in terms of speed and scalability. Our algorithm, called HyperANF, uses the new HyperLogLog counters and combines them efficiently through broadword programming; our implementation uses overdecomposition to exploit multi-core parallelism. With HyperANF, for the first time we can compute in a few hours the neighbourhood function of graphs with billions of nodes with a small error and good confidence using a standard workstation. Then, we turn to the study of the distribution of the shortest paths between reachable nodes (that can be efficiently approximated by means of HyperANF), and discover the surprising fact that its index of dispersion provides a clear-cut characterisation of proper social networks vs. web graphs. We thus propose the spid (Shortest-Paths Index of Dispersion) of a graph as a new, informative statistics that is able to discriminate between the above two types of graphs. We believe this is the first proposal of a significant new non-local structural index for complex networks whose computation is highly scalable.

研究の動機と目的

  • 非常に大きなグラフの近傍関数を、正確に計算することが計算的に不可能な場合に、スケーラブルで効率的な近似手法を開発すること。
  • 高度な確率的カウントと低レベル最適化を用いて、メモリ使用量を削減し、速度を向上させることで、ANFアルゴリズムを改善すること。
  • 標準的なハードウェアを用いて、10億ノードを超えるグラフにおいて有効直径および関連する指標を計算可能にすること。
  • 最短経路距離の分散に基づいて、ソーシャルネットワークとウェブグラフを区別できる新しい構造的指標であるspid(最短経路分散インデックス)を同定・検証すること。
  • 再現可能性のある研究および大規模解析を可能にするために、WebGraphフレームワーク内に自由に利用可能な高性能実装を提供すること。

提案手法

  • tホップ以内に到達可能なノードの個数を推定するためにハイパーログログカウンタを採用し、ANFにおけるO(n log n)のメモリ使用量をO(n log log n)に削減する。
  • ブロードワードプログラミングを用いて、ノード間でハイパーログログカウンタを並列に統合し、コンactなカウンタ表現に対する高速なワード単位の演算を実現する。
  • タスク分解を適用してマルチコア並列処理を活用し、利用可能なCPUコアにわたって到達可能集合の計算を分散する。
  • ハイパーログログの確率的性質を活用して、すべての近似値に統計的信頼区間を維持し、信頼性を保証する。
  • 各ノードが自身の現在の到達可能推定値を隣接ノードに伝播する、システリックで反復的な計算を採用し、カウンタの更新を用いて各ノードの周囲の「ボール」の拡大を追跡する。
  • 到達可能なノードペア間の距離の最終的分布を用いて、分散インデックス(spid)を計算し、新たなグローバルネットワーク指標を導出する。

実験結果

リサーチクエスチョン

  • RQ1確率的カウントを用いることで、10億ノード規模のグラフの近傍関数を、高い精度と低いメモリ使用量で近似可能か?
  • RQ2ソーシャルネットワークとウェブグラフにおける最短経路距離の分布はどのように異なるか? そして、これを1つのスケーラブルな指標で定量化可能か?
  • RQ3spid(最短経路分散インデックス)は、ソーシャルネットワークとウェブグラフを区別する信頼性のある非局所的構造的インデックスとして機能可能か?
  • RQ4HyperANFは、大規模グラフにおいてANFおよびHADIと比較して、性能およびメモリ効率に優れているか?
  • RQ5有向グラフを対称化することは、距離分布やspidの観点から、根本的な構造的性質を歪めてしまうか?

主な発見

  • HyperANFは、128GBメモリ搭載の標準ワークステーションで、10億ノードを超えるグラフの近傍関数を数時間で計算し、高い精度と統計的信頼性を達成した。
  • ANFにおけるO(n log n)のメモリ使用量をO(n log log n)に削減したことで、ANFの実用的限界をはるかに超えるスケーラビリティが実現された。
  • HADI(MapReduceベースのANF実装)と比較して、HyperANFは20億リンクのクラインカー・グラフにおいて、ラップトップで15分未満で同じ関数を計算したのに対し、HADIは90台のスーパーコンピュータノードを用いて30分を要した。
  • spid指標は、ソーシャルネットワーク(低分散)とウェブグラフ(高分散)を信頼性高く区別でき、グラフサイズや密度とは相関がなかった。
  • ウェブグラフの巨大成分のspidは、全体グラフのspidとほぼ同一であり、サンプリングアーティファクトやクローラーのバイアスに対して頑健であることが示された。
  • 有向グラフを対称化すると、平均距離とspidが著しく低下し、この前処理が意味のある構造的情報を破壊するため、ネットワーク解析においては避けるべきであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。