Skip to main content
QUICK REVIEW

[論文レビュー] Graph Size Estimation

Maciej Kurant, Carter T. Butts|arXiv (Cornell University)|Oct 1, 2012
Complex Network Analysis Techniques参考文献 47被引用数 21
ひとこと要約

本稿では、ノードのサンプルを用いてグラフサイズ $N$ を推定するための新規手法 IE(Induced Edges)と、ランダムウォーク(RW)サンプルにおける依存性を補正するための SafetyMargin を提案する。IE と SafetyMargin を組み合わせることで、Facebook データ上での状態技術よりサンプリングコストを 100 倍以上低減し、極めて少ないサンプル数で高い正確性を達成する。

ABSTRACT

Many online networks are not fully known and are often studied via sampling. Random Walk (RW) based techniques are the current state-of-the-art for estimating nodal attributes and local graph properties, but estimating global properties remains a challenge. In this paper, we are interested in a fundamental property of this type - the graph size N, i.e., the number of its nodes. Existing methods for estimating N are (i) inefficient and (ii) cannot be easily used with RW sampling due to dependence between successive samples. In this paper, we address both problems. First, we propose IE (Induced Edges), an efficient technique for estimating N from an independence sample of graph's nodes. IE exploits the edges induced on the sampled nodes. Second, we introduce SafetyMargin, a method that corrects estimators for dependence in RW samples. Finally, we combine these two stand-alone techniques to obtain a RW-based graph size estimator. We evaluate our approach in simulations on a wide range of real-life topologies, and on several samples of Facebook. IE with SafetyMargin typically requires at least 10 times fewer samples than the state-of-the-art techniques (over 100 times in the case of Facebook) for the same estimation error.

研究の動機と目的

  • 大規模で部分的に観測されたグラフにおけるノード総数 $N$ を推定する課題に対処すること。特に、完全なデータが入手できない状況を想定する。
  • ランダムウォーク(RW)サンプリングによって生じる依存サンプルに対応できない既存手法の非効率性と不適応性を克服すること。
  • オンラインソーシャルネットワークや分散システムなどの現実のサンプリング制約を踏まえた、実用的で効率的な $N$ の推定器を開発すること。
  • 独立サンプリングが不可能な状況においても、最小限のサンプリングコストで正確なグラフサイズ推定を実現すること。

提案手法

  • IE は、サンプルされたノードの間に誘導されるエッジ数を分析することで $N$ を推定する。エッジ密度とグラフ全体のサイズに相関があることに着目している。
  • SafetyMargin は、連続するサンプル間の相関構造に基づくマージン補正を用いて、推定器の分散を補正することで、RW サンプルの依存性を是正する。
  • IE と SafetyMargin を組み合わせることで、サンプルの依存性にもかかわらず正確性を維持できる、RW に適合した強固な推定器を構築する。
  • 非一様サンプリングモデルを用い、一様および非一様ノードサンプリングの両方を扱う理論的補正を導出する。
  • $O(n)$ 時間の最適化された Python 実装を提供し、大規模グラフへの効率的導入を可能にする。
  • 実世界のトポロジーを用いたシミュレーションと、Facebook データセットを用いた実験的評価により、一様サンプリングおよび RW サンプリングの両方でフレームワークを検証する。

実験結果

リサーチクエスチョン

  • RQ1独立ノードサンプルを用いて、既存手法よりも効率的にグラフサイズ $N$ を推定できるか?
  • RQ2既存の推定器を、ランダムウォークから得られる依存サンプルに効果的に適応できるか?
  • RQ3ランダムウォークサンプリング下で、バイアスと分散を信頼性高く低減する補正機構は何か?
  • RQ4IE と SafetyMargin を組み合わせることで、Facebook のような実世界ネットワークにおいて、どの程度サンプリング効率が向上するか?

主な発見

  • IE に SafetyMargin を組み合わせることで、Facebook データ上での推定誤差が同じ場合、状態技術より少なくとも 10 倍、最大で 100 倍のサンプリングコスト低減が達成される。
  • Facebook’09 データでは、IE は 10 倍少ないサンプル数で NODE と同等の正確性を達成し、サンプリングコストを 10 倍に低減する。
  • Facebook’10 データでは、IE と SafetyMargin の組み合わせにより、標準的手法と比較して 100 倍以上のサンプリングコスト低減が達成される。
  • SafetyMargin は、RW サンプルの依存度が高くても安定して集中した推定値を生成するが、標準的なスプライシング手法では安定化せず、解釈可能な結果を得られない。
  • Facebook’09 について、$N \approx 240M$ の推定が可能であり、Facebook の公式発表と整合的であるため、正確性が裏付けられる。
  • オープンソースの Python 実装により、$O(n)$ 時間計算量が保証され、実世界への展開に適したスケーラブルで実用的な手法である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。