Skip to main content
QUICK REVIEW

[論文レビュー] A Data-Based Approach to Social Influence Maximization

Amit Goyal, Francesco Bonchi|arXiv (Cornell University)|Sep 30, 2011
Complex Network Analysis Techniques参考文献 6被引用数 11
ひとこと要約

この論文は、エッジ確率の学習やモンテカルロシミュレーションを必要とせず、歴史的伝播トレースから直接に影響拡散を予測する、データベースの影響拡大モデルであるクレジット配分(CD)を提案する。CDモデルは、従来の手法と比較して、オーダー・オブ・マグニチュード速く、スケーラビリティに優れ、真値に最も近い高い正確性を達成する。

ABSTRACT

Influence maximization is the problem of finding a set of users in a social network, such that by targeting this set, one maximizes the expected spread of influence in the network. Most of the literature on this topic has focused exclusively on the social graph, overlooking historical data, i.e., traces of past action propagations. In this paper, we study influence maximization from a novel data-based perspective. In particular, we introduce a new model, which we call credit distribution, that directly leverages available propagation traces to learn how influence flows in the network and uses this to estimate expected influence spread. Our approach also learns the different levels of influenceability of users, and it is time-aware in the sense that it takes the temporal nature of influence into account. We show that influence maximization under the credit distribution model is NP-hard and that the function that defines expected spread under our model is submodular. Based on these, we develop an approximation algorithm for solving the influence maximization problem that at once enjoys high accuracy compared to the standard approach, while being several orders of magnitude faster and more scalable.

研究の動機と目的

  • 仮定されたまたは推定されたエッジ確率に依存する従来の影響拡大手法の限界に対処すること。
  • 実データから学習されたものと比較して、仮定に基づくエッジ確率割り当て法が影響拡散予測にどの程度効果的かを調査すること。
  • 高価なモンテカルロシミュレーションやエッジ確率の学習を回避する、スケーラブルで正確な影響拡大手法を開発すること。
  • 学習確率のノイズに対する影響拡大ソリューションのロバストネスを評価し、トレーニングデータ量がシード選択の質に与える影響を検証すること。

提案手法

  • 歴史的アクション伝播トレースから個々のエッジ確率を学習せず、直接に影響拡散を推定するクレジット配分(CD)モデルを提案する。
  • 計算コストを削減しながら正確性を維持するため、伝播深さを制限するための切断閾値λを用いる。
  • サブモジュラリティを活用して近似保証を得るため、CDモデルの影響拡散推定に基づいてグリーディアルゴリズムでシードノードを選択する。
  • 直接的にアクションログをマイニングして期待影響拡散を計算することで、モンテカルロシミュレーションを回避し、スケーラビリティを著しく向上させる。
  • ネットワーク内の影響伝播の時間的ダイナミクスを考慮するためのタイムアウェアメカニズムを導入する。
  • 実世界のデータセット(Flixster, Flickr)を用い、数百万件の伝播タプルを活用してモデルのトレーニングと評価を実施する。

実験結果

リサーチクエスチョン

  • RQ1仮定に基づくエッジ確率割り当て法(例:定数、逆入次数)が、実データから学習されたものと比較して、影響拡散予測にどの程度効果的か。
  • RQ2学習確率を用いた従来のモデル(IC, LT)が真値とどの程度異なり、シード選択と拡散予測に影響を及けるか。
  • RQ3歴史的伝播トレースから直接に学習するモデルが、エッジ確率推定とモンテカルロシミュレーションを必要とする手法を上回る性能を示せるか。
  • RQ4影響拡大の性能は、学習確率のノイズに対してどの程度感受的か。また、こうした摂動に対してソリューションはどの程度ロバストか。
  • RQ5近似的に最適なシード選択品質を得るための最小限のトレーニングデータ(伝播トレース)量はどの程度か。

主な発見

  • クレジット配分モデルは、Flixster LargeおよびFlickr Largeの両データセットにおいて、真値に最も近い高い正確性を達成し、影響拡散予測の正確性が最も高い。
  • 650万タプルのFlixsterデータセット全体を使用するのと比較して、わずか100万タプルのデータのみを用いても、CDモデルは同程度の影響拡散とシードセット品質を達成する。
  • Flickr Largeでは、800万タプルの時点で影響拡散が収束しており、高品質なシード選択に十分な少量のトレースで十分であることが示された。
  • モデルの性能は、切断閾値λ = 0.001で飽和し、それ以上の向上は顕著に見られず、実用的かつ効率的な選択肢であることが判明した。
  • 任意に確率を割り当てる手法(例:定数、三値化)は、データ駆動型手法と比較して顕著に異なるシードセットを生成し、大きな予測誤差を引き起こす。
  • CDモデルにおけるグリーディアルゴリズムは非常にスケーラブルであり、モンテカルロベースのアプローチと比較して、著しく短い実行時間と低いメモリ使用量で高い正確性を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。