[论文解读] Learning Multivariate Hawkes Processes at Scale
本文提出了一种可扩展的方法,通过利用现实世界事件序列中的稀疏性,实现多变量 Hawkes 过程(MHPs)的精确似然和梯度计算,且计算复杂度与网络规模无关。该方法在稀疏数据上实现了最先进水平的预测性能和多个数量级的加速,从而能够对大规模扩散过程进行可解释建模。
Multivariate Hawkes Processes (MHPs) are an important class of temporal point processes that have enabled key advances in understanding and predicting social information systems. However, due to their complex modeling of temporal dependencies, MHPs have proven to be notoriously difficult to scale, what has limited their applications to relatively small domains. In this work, we propose a novel model and computational approach to overcome this important limitation. By exploiting a characteristic sparsity pattern in real-world diffusion processes, we show that our approach allows to compute the exact likelihood and gradients of an MHP -- independently of the ambient dimensions of the underlying network. We show on synthetic and real-world datasets that our model does not only achieve state-of-the-art predictive results, but also improves runtime performance by multiple orders of magnitude compared to standard methods on sparse event sequences. In combination with easily interpretable latent variables and influence structures, this allows us to analyze diffusion processes at previously unattainable scale.
研究动机与目标
- 为克服多变量 Hawkes 过程(MHPs)在大规模扩散过程中的可扩展性限制。
- 实现在不依赖环境网络维度的前提下,对 MHPs 进行精确的似然和梯度计算。
- 利用现实世界事件序列中的固有稀疏性,显著降低计算复杂度。
- 在扩展至数万个实体的数据集时,保持模型的可解释性及影响结构推断能力。
- 在合成数据和真实世界数据集(包括政策扩散和 Reddit 超链接网络)上,展示最先进水平的性能和运行时效率。
提出的方法
- 提出一种新型模型——Lazy MHP,通过非负矩阵分解对 MHP 参数进行分解,以利用事件序列中的稀疏性。
- 设计一种计算框架,实现在 O(|X| + |H|·E) 时间内精确计算对数似然和梯度,其中 |X| 为实体数量,|H| 为事件数量,E 为唯一事件对的数量。
- 对激发矩阵 α 进行非负分解,得到潜在因子 u_x 和 v_y,从而实现对影响结构的高效且可解释的建模。
- 采用基于稀疏事件的计算方案,避免完整的矩阵运算,仅关注观测到的事件交互。
- 采用随机优化与小批量采样策略,使训练可扩展至大规模数据集,同时保持收敛性和准确性。
- 即使在包含超过 55,000 个实体的数据集(如 Reddit 超链接)上,也能实现对影响矩阵 α 和潜在因子 u_x、v_y 的完整推断。
实验结果
研究问题
- RQ1多变量 Hawkes 过程能否在真实世界稀疏事件序列上实现高效的大规模训练?
- RQ2利用事件序列中的稀疏性是否能实现与网络规模无关的精确似然计算?
- RQ3所提出的方法是否能在实现显著加速的同时,保持影响结构和潜在因子的可解释性?
- RQ4与现有方法相比,该模型在大规模数据集上的预测准确性和运行时间表现如何?
- RQ5该模型能否在大规模扩散过程(如 Reddit 超链接级联)中揭示有意义且主题一致的潜在结构?
主要发现
- 与标准 MHP 推断相比,该方法在稀疏序列上也实现了多个数量级的训练时间加速。
- 该模型在合成数据和真实世界数据集(包括 State Policy Innovation and Diffusion Database (SPID))上均达到了最先进水平的预测性能。
- 在包含超过 55,000 个实体和 860,000 个事件的 Reddit Hyperlinks 数据集上,模型每轮训练耗时约 650 秒,100 轮后对数似然达到约 -9.1。
- 推断出的影响矩阵 α 和潜在因子 u_x、v_y 清晰地揭示了区域性和主题性结构,例如纽约州影响邻近州,而加利福尼亚州在西海岸具有影响力。
- 该模型在 Reddit 中识别出主题一致的潜在组件,如音乐、体育和游戏社区,展示了在大规模场景下的可解释性。
- 该方法使原本对 MHP 不可行的大规模数据集(如包含 728 项政策、时间跨度为 1691–2017 年的完整 SPID 数据库)能够实现对影响结构和潜在因子的完整推断。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。