Skip to main content
QUICK REVIEW

[论文解读] Modeling Information Cascades with Self-exciting Processes via Generalized Epidemic Models

Quyu Kong, Marian-Andrei Rizoiu|arXiv (Cornell University)|Oct 12, 2019
Complex Network Analysis Techniques参考文献 26被引用 5
一句话总结

本文通过将SIR模型中的恢复时间分布与HawkesN过程中的核函数关联,建立了有限人群中随机SIR流行病模型与自激式Hawkes过程之间的广义数学联系。提出了具有任意恢复时间分布的广义SIR模型,推导了恢复危险函数与Hawkes核之间的关系,并开发了模拟、拟合与预测工具。主要贡献在于通过结合互补模型(尤其是EXPN与PL)显著提升了Twitter转发级联的流行度预测效果。

ABSTRACT

Epidemic models and self-exciting processes are two types of models used to describe diffusion phenomena online and offline. These models were originally developed in different scientific communities, and their commonalities are under-explored. This work establishes, for the first time, a general connection between the two model classes via three new mathematical components. The first is a generalized version of stochastic Susceptible-Infected-Recovered (SIR) model with arbitrary recovery time distributions; the second is the relationship between the (latent and arbitrary) recovery time distribution, recovery hazard function, and the infection kernel of self-exciting processes; the third includes methods for simulating, fitting, evaluating and predicting the generalized process. On three large Twitter diffusion datasets, we conduct goodness-of-fit tests and holdout log-likelihood evaluation of self-exciting processes with three infection kernels --- exponential, power-law and Tsallis Q-exponential. We show that the modeling performance of the infection kernels varies with respect to the temporal structures of diffusions, and also with respect to user behavior, such as the likelihood of being bots. We further improve the prediction of popularity by combining two models that are identified as complementary by the goodness-of-fit tests.

研究动机与目标

  • 建立随机SIR模型与有限人群中自激式Hawkes过程之间的广义数学联系。
  • 将SIR模型扩展至允许任意恢复时间分布,突破传统分段常数假设的限制。
  • 为广义SIR与HawkesN过程开发计算工具——包括模拟、参数估计、拟合优度检验与流行度预测。
  • 研究不同感染核函数(指数型、幂律型、Tsallis Q-指数型)在具有不同时间动态与用户行为特征的级联中的表现。
  • 通过拟合优度分析识别互补模型,结合其预测结果以提升最终级联流行度预测效果。

提出的方法

  • 提出具有任意恢复时间分布的广义随机SIR模型,允许个体独立恢复。
  • 推导SIR模型中恢复时间的互补累积分布函数(CCDF)与HawkesN过程中核函数之间的理论联系,表明CCDF构成核函数的上界。
  • 建立SIR恢复危险函数、恢复时间分布与HawkesN核函数之间的数学关系。
  • 引入通过成对抽样感染时间与恢复时间实现的模拟方法,实现广义SIR过程的高效生成。
  • 为具有通用核函数的SIR与HawkesN模型开发最大对数似然估计方法。
  • 采用两种拟合优度度量与基于绝对相对误差(ARE)的流行度预测框架,通过平均互补模型的预测结果实现模型组合。

实验结果

研究问题

  • RQ1如何对广义SIR模型中任意恢复时间分布与有限人群Hawkes过程(HawkesN)进行形式化数学关联?
  • RQ2在具有不同时间动态的信息级联中,HawkesN模型中不同感染核函数(指数型、幂律型、Tsallis Q-指数型)的表现如何?
  • RQ3用户行为(尤其是机器人参与)在多大程度上影响不同HawkesN核模型的拟合效果与性能表现?
  • RQ4能否通过结合在不同级联中表现互补的模型,实现超越单一模型的最终流行度预测效果提升?
  • RQ5在真实世界数据中,如何在SIR与HawkesN建模框架中处理未观测到的恢复事件?

主要发现

  • 广义SIR模型中恢复时间的CCDF构成HawkesN核函数的上界,建立了两类模型之间的正式数学联系。
  • 在NEWS Twitter数据集中,指数核(EXPN)在事件数量较多且持续时间较短的级联中拟合效果更优,这与机器人参与度提升相关。
  • 在NEWS、Seismic与ActiveRT三个数据集上,幂律核(PL)在最终流行度预测中均优于指数核与Tsallis Q-指数核。
  • 组合模型通过平均EXPN与PL的预测结果,在所有数据集中均显著优于单一模型,实现了最低的绝对相对误差(ARE)。
  • 拟合优度检验表明,模型表现显著受级联时间结构与用户行为影响,表明信息传播中存在多种动力机制共存。
  • 使用10组并行初始化拟合500事件级联,平均耗时4.8分钟(CPU主频2.2 GHz),似然评估复杂度随事件数呈二次方增长。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。