[论文解读] Learning Hawkes Processes from a Handful of Events
该论文提出了一种变分期望最大化算法,用于从短事件序列中学习多变量霍克斯过程,实现了对多个超参数的高效优化,并通过后验分布建模参数不确定性。在小样本场景下显著优于最先进方法,同时在大规模数据集上也保持了强劲性能。
Learning the causal-interaction network of multivariate Hawkes processes is a useful task in many applications. Maximum-likelihood estimation is the most common approach to solve the problem in the presence of long observation sequences. However, when only short sequences are available, the lack of data amplifies the risk of overfitting and regularization becomes critical. Due to the challenges of hyper-parameter tuning, state-of-the-art methods only parameterize regularizers by a single shared hyper-parameter, hence limiting the power of representation of the model. To solve both issues, we develop in this work an efficient algorithm based on variational expectation-maximization. Our approach is able to optimize over an extended set of hyper-parameters. It is also able to take into account the uncertainty in the model parameters by learning a posterior distribution over them. Experimental results on both synthetic and real datasets show that our approach significantly outperforms state-of-the-art methods under short observation sequences.
研究动机与目标
- 解决在仅有短观测序列时学习多变量霍克斯过程中因果交互网络的挑战。
- 克服在数据稀缺条件下标准最大似然估计的局限性,其中过拟合和不良正则化是主要问题。
- 通过在扩展的超参数集合上进行优化,而非依赖单一共享参数,实现灵活的高维正则化。
- 通过在参数上学习后验分布来纳入模型不确定性,为因果图中的边识别提供置信度估计。
- 提升在小样本应用场景(如流行病建模、金融事件预测和社会网络动态)中的性能。
提出的方法
- 将霍克斯过程学习问题表述为贝叶斯推断任务,将模型参数视为具有先验分布的隐变量。
- 开发一种变分推断框架,使用对激发矩阵和超参数的变分分布来近似真实后验分布。
- 设计一种变分期望最大化(V-EM)算法,通过证据下界(ELBO)最大化,在估计后验分布(E步)和优化超参数(M步)之间交替进行。
- 引入灵活的先验结构,为激发矩阵中的每个条目分配独立的超参数,实现个性化的正则化。
- 使用随机优化方法,高效计算ELBO相对于变分参数和超参数的梯度。
- 通过后验近似方差来评估边检测的置信度,实现不确定性量化,尤其在低数据场景下表现突出。
实验结果
研究问题
- RQ1与最大似然方法相比,变分期望最大化方法是否能在短数据场景下提升多变量霍克斯过程的学习性能?
- RQ2在多个独立超参数上进行优化,是否能带来比单共享超参数正则化更好的模型表征能力和泛化性能?
- RQ3通过后验分布建模参数不确定性,是否能在数据稀缺时提升边识别的可靠性?
- RQ4该方法在真实世界数据集(如流行病传播和股价变动)上事件数量有限时表现如何?
- RQ5该方法是否在保持大规模数据集上强性能的同时,于小样本场景中表现出色?
主要发现
- 在仅包含5,349个总事件的埃博拉疫情数据集(54个地区)上,所提出的VI-SG方法实现了-2.06的预测对数似然,显著优于MLE-SGLP的-3.03。
- 在包含7,089个事件的股票市场数据集上,VI-SG实现了-1.00的预测对数似然,优于MLE-SGLP的-2.45及其他基线方法。
- 在包含74,294个事件的Enron邮件数据集上,VI-EXP变体实现了-0.23的最高预测对数似然,超过MLE-ADM4的-0.40。
- 在学习到的因果图中,假阳性边的不确定性(以权重的标准差衡量)高于真阳性边,证实了该方法在数据稀缺条件下识别可靠边的能力。
- 在真实激发矩阵中,真实边对应的优化先验超参数α显著高于非边,表明正则化效果有效。
- 该方法在大规模数据场景中也保持了强性能,展示了在不同数据规模下的鲁棒性,且未牺牲小样本场景下的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。