Skip to main content
QUICK REVIEW

[論文レビュー] Modeling Information Cascades with Self-exciting Processes via Generalized Epidemic Models

Quyu Kong, Marian-Andrei Rizoiu|arXiv (Cornell University)|Oct 12, 2019
Complex Network Analysis Techniques参考文献 26被引用数 5
ひとこと要約

本稿は、有限集団における確率的SIR疫学モデルと自己励起型Hawkes過程の間の一般化された数学的関係を確立し、SIRモデルにおける回復時間分布をHawkesN過程におけるカーネル関数に結びつける。任意の回復時間分布を許容する一般化SIRモデルを導入し、回復ハザード関数とHawkesカーネルの関係を導出。シミュレーション、フィッティング、予測ツールを開発。主な貢献は、Twitterのリツイートカスケードにおいて、特にEXPNおよびPLモデルを組み合わせることで、普及度の予測精度が向上することである。

ABSTRACT

Epidemic models and self-exciting processes are two types of models used to describe diffusion phenomena online and offline. These models were originally developed in different scientific communities, and their commonalities are under-explored. This work establishes, for the first time, a general connection between the two model classes via three new mathematical components. The first is a generalized version of stochastic Susceptible-Infected-Recovered (SIR) model with arbitrary recovery time distributions; the second is the relationship between the (latent and arbitrary) recovery time distribution, recovery hazard function, and the infection kernel of self-exciting processes; the third includes methods for simulating, fitting, evaluating and predicting the generalized process. On three large Twitter diffusion datasets, we conduct goodness-of-fit tests and holdout log-likelihood evaluation of self-exciting processes with three infection kernels --- exponential, power-law and Tsallis Q-exponential. We show that the modeling performance of the infection kernels varies with respect to the temporal structures of diffusions, and also with respect to user behavior, such as the likelihood of being bots. We further improve the prediction of popularity by combining two models that are identified as complementary by the goodness-of-fit tests.

研究の動機と目的

  • 有限集団における確率的SIRモデルと自己励起型Hawkes過程の間の一般化された数学的関係を確立すること。
  • 標準的な区分定数仮定を越えて、任意の回復時間分布を許容するSIRモデルの拡張を図ること。
  • 一般化SIRおよびHawkesN過程の両方のための、シミュレーション、パラメータ推定、適合度評価、普及度予測の計算ツールを開発すること。
  • 異なる感染カーネル関数(指数関数的、力学的法則、Tsallis Q-指数関数的)が、時間的ダイナミクスやユーザ行動に差があるカスケードにおいて、どのように性能を発揮するかを調査すること。
  • 適合度分析を通じて補完的であると特定されたモデルを組み合わせることで、最終的なカスケード普及度の予測精度を向上させること。

提案手法

  • 個々の感染者の回復時間が独立であることを許容する、任意の回復時間分布を許容する一般化された確率的SIRモデルを提案する。
  • SIRモデルにおける回復時間の補完的累積分布関数(CCDF)とHawkesN過程におけるカーネル関数との理論的関係を導出し、CCDFが上界として機能することを示す。
  • SIRモデルの回復ハザード関数、回復時間分布、HawkesNカーネル関数の間の数学的関係を確立する。
  • 感染時刻と回復時刻のペアドサンプリングによるシミュレーション手法を導入し、一般化SIR過程の効率的生成を可能にする。
  • 一般カーネルを有するSIRおよびHawkesNモデルのための最対数尤度推定手順を開発する。
  • 2つの適合度評価指標と、絶対相対誤差(ARE)を用いた普及度予測フレームワークを採用。補完的モデルの予測を平均化することでモデルの組み合わせを実現する。

実験結果

リサーチクエスチョン

  • RQ1任意の回復時間分布を許容する一般化SIRモデルを、有限集団におけるHawkes過程(HawkesN)と正式に結びつける方法は何か?
  • RQ2HawkesNモデルにおける異なる感染カーネル関数(指数関数的、力学的法則、Tsallis Q-指数関数的)は、時間的ダイナミクスに差がある情報カスケードにおいて、どのように性能を発揮するか?
  • RQ3特にボット参加の有無が、異なるHawkesNカーネルモデルの適合度および性能に及ぼす影響はどの程度か?
  • RQ4異なるカスケードで補完的性能を示すモデルを組み合わせることで、個々のモデルを上回る最終的な普及度予測が可能か?
  • RQ5現実世界のデータにおける観測されない回復イベントは、SIRおよびHawkesNモデリングフレームワーク内でどのように扱えるか?

主な発見

  • 一般化SIRモデルにおける回復時間のCCDFは、HawkesNにおけるカーネル関数の上界として機能し、両モデルクラスの正式な数学的関係を確立する。
  • NEWS Twitterデータにおいて、イベント数が多く、期間が短いカスケードでは、指数関数的カーネル(EXPN)がより良好に適合し、ボット参加の増加と相関している。
  • すべての3つのデータセット(NEWS、Seismic、ActiveRT)において、力学的法則カーネル(PL)が指数関数的およびTsallis Q-指数関数的カーネルを上回り、最終的な普及度予測において優れた性能を示した。
  • EXPNおよびPLの予測を平均化する組み合わせモデルは、すべてのデータセットで個々のモデルを上回り、絶対相対誤差(ARE)が最小となる一貫した性能を発揮した。
  • 適合度テストの結果、モデルの性能はカスケードの時間的構造とユーザ行動に顕著に依存しており、情報拡散において複数の動的メカニズムが共存していることが示唆された。
  • 10個の並列初期化を用いた500イベントのカスケードのフィッティングには、2.2 GHz CPU上で平均4.8分を要し、尤度評価の計算複雑度はイベント数に二次的に依存する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。