Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Influence Estimation Without Sampling

Andrey Y. Lokhov, David Saad|arXiv (Cornell University)|Dec 29, 2019
Complex Network Analysis Techniques参考文献 60被引用数 9
ひとこと要約

本稿では、モンテカルロサンプリングを用いずに、拡散ネットワークにおける影響推定のためのスケーラブルな動的メッセージパッシング(DMP)アルゴリズムを提案する。ノードあたり線形の計算量を達成し、木構造のグラフでは正確な結果を提供する。ループを含むネットワークでは影響拡散の上界を提供し、独立キャスケード(IC)モデルおよび線形しきい値(LT)モデルの両方において、速度と正確性の面でサンプリングベースの手法を著しく上回る。

ABSTRACT

In a diffusion process on a network, how many nodes are expected to be influenced by a set of initial spreaders? This natural problem, often referred to as influence estimation, boils down to computing the marginal probability that a given node is active at a given time when the process starts from specified initial condition. Among many other applications, this task is crucial for a well-studied problem of influence maximization: finding optimal spreaders in a social network that maximize the influence spread by a certain time horizon. Indeed, influence estimation needs to be called multiple times for comparing candidate seed sets. Unfortunately, in many models of interest an exact computation of marginals is #P-hard. In practice, influence is often estimated using Monte-Carlo sampling methods that require a large number of runs for obtaining a high-fidelity prediction, especially at large times. It is thus desirable to develop analytic techniques as an alternative to sampling methods. Here, we suggest an algorithm for estimating the influence function in popular independent cascade model based on a scalable dynamic message-passing approach. This method has a computational complexity of a single Monte-Carlo simulation and provides an upper bound on the expected spread on a general graph, yielding exact answer for treelike networks. We also provide dynamic message-passing equations for a stochastic version of the linear threshold model. The resulting saving of a potentially large sampling factor in the running time compared to simulation-based techniques hence makes it possible to address large-scale problem instances.

研究の動機と目的

  • 大規模ネットワークにおける影響推定のためのモンテカルロサンプリングの高い計算コストを軽減すること。
  • 独立キャスケード(IC)モデルおよび線形しきい値(LT)モデルにおける影響拡散を正確に推定する解析的手法を開発すること。
  • 高速でスケーラブルかつ正確な影響関数推定を可能にすることで、効率的な影響最大化を実現すること。
  • 固定のシード集合にとどまらず、確率的ノード活性化を含む任意の初期シーディング条件を扱えること。
  • サンプリングに依存するのを減らし、理論的保証を伴う決定的で低計算量の代替手法を提供すること。

提案手法

  • 影響伝播の正確な要因分解を用いて、木構造グラフ上のマージナル活性化確率を推定するための動的メッセージパッシング方程式を導出する。
  • ループ付きグラフへの適用のために、木構造ベースのメッセージパッシングフレームワークをループ付き信念パッシング近似を用いて拡張し、エッジ数に対して線形時間計算量を維持する。
  • 有限時間および無限時間の影響推定をそれぞれ対象とするDMPestおよびDMPinfアルゴリズムを導入。木構造では正確な結果を、一般のグラフでは上界を提供する。
  • ノードが非活性のままなる確率を、隣接ノードからのメッセージの積としてモデル化し、時間依存の活性化ダイナミクスを考慮する。
  • ノード固有の初期活性化確率$p_i(0)$をメッセージパッシングフレームワークに組み込むことで、確率的初期条件を扱う。
  • 線形しきい値モデルの確率的版に対する動的メッセージパッシング方程式を提供し、ICモデルを超えた拡張を実現する。

実験結果

リサーチクエスチョン

  • RQ1サンプリングを用いずに、正確性とスケーラビリティを維持した影響推定が可能か?
  • RQ2サンプリングを避ける解析的手法の計算量はどの程度か?
  • RQ3提案されたDMP手法は木構造ネットワークでは正確な結果を提供し、一般の(ループ付き)グラフでは上界を提供するか?
  • RQ4任意の初期シーディング条件、特にノードの確率的活性化下でも、この手法はどのように動作するか?
  • RQ5DMPフレームワークは、確率的しきい値を有する線形しきい値モデルへ拡張可能か?

主な発見

  • 提案されたDMPに基づく影響推定手法は、1回のモンテカルロシミュレーションと同等の計算量を有し、サンプリングベースの手法に比べて顕著な高速化を実現する。
  • 本手法は木構造グラフでは正確な影響推定を提供し、一般のループ付きグラフでは上界を提供するため、理論的信頼性が保証される。
  • 独立キャスケードモデルにおいて、DMPestおよびDMPinfはエッジ数に対して線形スケーリングを達成するため、大規模ネットワークに適している。
  • 数値実験により、高い正確性とスケーラビリティが確認され、本手法は速度と忠実度の両面でサンプリング技術を上回っている。
  • 本手法は確率的初期シーディング条件へ一般化可能であり、実世界の予算制約付きの影響キャンペーンの柔軟なモデリングを可能にする。
  • 確率的線形しきい値モデルへの拡張は、動的メッセージパッシング方程式を用いることで達成され、本手法の適用範囲が広がっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。