[论文解读] Marked Self-Exciting Point Process Modelling of Information Diffusion on Twitter
本文提出 MaSEPTiDE,一种标记自激发点过程模型,通过使用参数化、时变的强度函数对转发级联进行建模,以预测推文的受欢迎程度。由于其完全参数化的结构,所需数据较少,因此在短观测窗口(例如6小时以内)下,其性能优于现有方法(如 TiDeH 和 SEISMIC)。
Information diffusion occurs on microblogging platforms like Twitter as retweet cascades. When a tweet is posted, it may be retweeted and henceforth further retweeted, and the retweeting process continues iteratively and indefinitely. A natural measure of the popularity of a tweet is the number of retweets it generates. Accurate predictions of tweet popularity can assist Twitter to rank contents more effectively and facilitate the assessment of potential for marketing and campaigning strategies. In this paper, we propose a model called the Marked Self-Exciting Process with Time-Dependent Excitation Function, or MaSEPTiDE for short, to model the retweeting dynamics and to predict the tweet popularity. Our model does not require expensive feature engineering but is capable of leveraging the observed dynamics to accurately predict the future evolution of retweet cascades. We apply our proposed methodology on a large amount of Twitter data and report substantial improvement in prediction performance over existing approaches in the literature.
研究动机与目标
- 开发一种稳健且数据高效的模型,基于早期转发动态预测推文的最终受欢迎程度。
- 解决现有非参数模型(如 TiDeH)的局限性,后者需要较长的观测时间及大量数据才能可靠估计传播性。
- 通过使用经过优化的组件函数的完全参数化强度函数公式,提高早期预测的准确性。
- 为 Twitter 等社交媒体平台提供一种可扩展且实用的实时受欢迎程度预测解决方案。
- 克服现有模型对高度转发级联(例如 >2,000 次转发)的偏差,这些级联较为罕见,不能代表普通推文。
提出的方法
- 将转发行为建模为标记自激发点过程,其中每次转发都会提高未来转发的强度。
- 采用由时变传播性函数和记忆核函数组成的参数化强度函数,两者均通过非线性优化进行估计。
- 使用 B 样条基函数灵活表示时变传播性函数和记忆核函数。
- 通过在训练数据上进行拟合优度评估,选择最优的参数形式(例如,传播性使用多项式衰减,记忆核使用指数衰减)。
- 在初步阶段应用非参数核平滑以辅助参数模型选择,但最终推断不依赖于该步骤。
- 通过随时间积分估计的强度函数来预测最终转发数,从而实现在有限观测窗口内实现早期预测。
实验结果
研究问题
- RQ1与非参数替代方法相比,完全参数化的标记自激发点过程模型是否能在早期预测推文受欢迎程度方面表现更优?
- RQ2当在短观测窗口(例如 2–6 小时)下训练时,MaSEPTiDE 的预测准确率与 TiDeH 和 SEISMIC 相比如何?
- RQ3与非参数方法相比,MaSEPTiDE 的参数化结构在多大程度上减少了数据需求并提高了估计稳定性?
- RQ4模型性能在不同级联长度下如何变化,特别是对于不太受欢迎的推文?
- RQ5考虑到大多数现有数据集偏向高度病毒式传播的内容,该模型是否能推广用于预测普通推文的受欢迎程度?
主要发现
- 在 2、4 和 6 小时的截断时间点,MaSEPTiDE 在条件中位数预测中的平均绝对误差(MAE)显著低于 TiDeH 和 SEISMIC。
- 在 8、10 和 12 小时时,MaSEPTiDE 的性能与 TiDeH 相当,但后者仅在 8 小时后获得微小优势——此时大多数转发已发生。
- 随着观测时间的增加,模型的预测准确率迅速提升,在推文发布后两小时内即可实现可靠结果。
- 参数化公式降低了对数据的依赖,即使在转发序列有限的情况下也能实现稳定估计。
- 由于对短观测期具有鲁棒性,该模型在大多数级联中(尤其是中等至高人气的级联)优于竞争方法。
- 本研究证实,基于高度转发级联(例如 >2,000 次转发)训练的模型不能代表普通推文,凸显了现有数据集的关键局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。