Skip to main content
QUICK REVIEW

[論文レビュー] Finding the Graph of Epidemic Cascades

Praneeth Netrapalli, Sujay Sanghavi|arXiv (Cornell University)|Feb 8, 2012
Complex Network Analysis Techniques参考文献 3被引用数 9
ひとこと要約

本稿では、感染時刻の観測のみを用いて、感染拡散の背後にあるネットワークグラフをデータ駆動で学習する手法を提案する。最大尤度(ML)推定器と貪欲アルゴリズムの両方が、情報理論的限界に近いサンプル複雑性で真のグラフ構造を信頼性高く回復できることを確立し、グローバル問題を局所的なノードレベルの推論問題に分離可能であることを示した。

ABSTRACT

We consider the problem of finding the graph on which an epidemic cascade spreads, given only the times when each node gets infected. While this is a problem of importance in several contexts -- offline and online social networks, e-commerce, epidemiology, vulnerabilities in infrastructure networks -- there has been very little work, analytical or empirical, on finding the graph. Clearly, it is impossible to do so from just one cascade; our interest is in learning the graph from a small number of cascades. For the classic and popular "independent cascade" SIR epidemics, we analytically establish the number of cascades required by both the global maximum-likelihood (ML) estimator, and a natural greedy algorithm. Both results are based on a key observation: the global graph learning problem decouples into $n$ local problems -- one for each node. For a node of degree $d$, we show that its neighborhood can be reliably found once it has been infected $O(d^2 \log n)$ times (for ML on general graphs) or $O(d\log n)$ times (for greedy on trees). We also provide a corresponding information-theoretic lower bound of $Ω(d\log n)$; thus our bounds are essentially tight. Furthermore, if we are given side-information in the form of a super-graph of the actual graph (as is often the case), then the number of cascade samples required -- in all cases -- becomes independent of the network size $n$. Finally, we show that for a very general SIR epidemic cascade model, the Markov graph of infection times is obtained via the moralization of the network graph.

研究の動機と目的

  • 観測された感染拡散の感染時刻から、ネットワーク構造を推定する逆問題に対処すること。
  • 感染過程における信頼性のあるグラフ回復に必要な最小のカスケード数を特定すること。
  • ネットワークサイズに比例してスケーリングが良く、局所的情報のみを必要とする効率的で分散型のアルゴリズムを開発すること。
  • 推定と回復性能の両方におけるサンプル複雑性のタイトな理論的境界を確立すること。
  • 事前情報としてのスーパーグラフの影響が、必要となるカスケード数に与える影響を調査すること。

提案手法

  • 各ノードごとに凸性を保証する変数変換を用いることで、グローバルなグラフ学習問題をノードごとの局所的推論問題 $n$ 個に分解する。
  • ノードのスーパーネighborhoodの感染時刻のみを用いて、真の隣接ノードを推定する最大尤度推定器を適用する。
  • 説明される感染数を最大化することで、反復的に最も可能性の高い親ノードを選択する貪欲アルゴリズムを設計する。
  • 感染時刻のマルコフ確率場が、元のグラフのモーラライズド版に対応することを、ネットワークグラフのモーラライゼーションを用いて示す。
  • 情報理論的解析を用いてサンプル複雑性の理論的境界を確立し、対数要因を除いてタイトであることを示す。
  • 合成および実世界のグラフ(例:Twitter)上でシミュレーションを実施し、さまざまな次数およびスーパーグラフ条件の下でMLと貪欲アルゴリズムの性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1感染時刻の観測から、信頼性高く元のネットワーク構造を回復するために必要な最小の感染拡散カスケード数は何か?
  • RQ2異なるアルゴリズムにおいて、ノードの真の次数に応じて、グラフ回復のサンプル複雑性はどのようにスケーリングするか?
  • RQ3グローバルなグラフ学習問題は、局所的かつノード固有の推論問題に分離可能か?その条件は何か?
  • RQ4スーパーグラフの事前知識がある場合、正確な回復に必要なカスケード数はどのように変化するか?
  • RQ5貪欲アルゴリズムの性能は、サイクルの存在を含むグラフのトポロジカル構造にどの程度依存するか?

主な発見

  • 最大尤度推定器において、次数 $d_i$ のノードは一般のグラフで $O(d_i^2 \text{log } n)$ 個の感染を必要とし、真の近隣ノードを信頼性高く回復できる。
  • 木構造のグラフにおける貪欲アルゴリズムでは、ノードあたり $O(d_i \log D_i)$ 個の感染で十分であり、$D_i$ はスーパーネighborhood のサイズを表す。
  • 情報理論的下界として $\Omega(d_i \log n)$ 個のカスケードが確立され、MLおよび貪欲アルゴリズムが最適性に対数要因を除いて達成していることが示された。
  • スーパーグラフが提供される場合、必要なカスケード数はネットワークサイズ $n$ に依存せず、次数 $d_i$ およびスーパーグラフサイズ $D_i$ のみに依存するようになる。
  • 200ノードの4正則グラフにおけるシミュレーションでは、スーパーグラフ情報がサンプル複雑性を中程度に低下させ、$D_i$ に対して対数的依存性が $n$ に対して対数的依存性と比較して顕著に改善された。
  • 実世界のTwitterグラフでは、貪欲アルゴリズムはノード次数に対してほぼ線形の依存性を示した一方、MLアルゴリズムは小さなサイクルを含むグラフでも超線形の成長を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。