[论文解读] A Monte Carlo EM Algorithm for the Parameter Estimation of Aggregated Hawkes Processes
本文提出了一种蒙特卡洛期望最大化(MC-EM)算法,用于在事件时间戳被分箱或舍入导致时间精度损失的情况下,对聚合霍克斯过程的参数进行估计。该方法在多种模拟场景下显著降低了参数估计的偏差和方差,相较于现有方法表现出更优的性能,适用于在现实数据聚合约束下对自激发点过程进行建模。
A key difficulty that arises from real event data is imprecision in the recording of event time-stamps. In many cases, retaining event times with a high precision is expensive due to the sheer volume of activity. Combined with practical limits on the accuracy of measurements, aggregated data is common. In order to use point processes to model such event data, tools for handling parameter estimation are essential. Here we consider parameter estimation of the Hawkes process, a type of self-exciting point process that has found application in the modeling of financial stock markets, earthquakes and social media cascades. We develop a novel optimization approach to parameter estimation of aggregated Hawkes processes using a Monte Carlo Expectation-Maximization (MC-EM) algorithm. Through a detailed simulation study, we demonstrate that existing methods are capable of producing severely biased and highly variable parameter estimates and that our novel MC-EM method significantly outperforms them in all studied circumstances. These results highlight the importance of correct handling of aggregated data.
研究动机与目标
- 解决在事件时间戳被聚合或分箱时,霍克斯过程参数估计出现偏差和变异的问题。
- 构建一个稳健的统计框架,用于从粗粒度的分箱事件计数中推断底层连续时间霍克斯过程的参数。
- 改进现有方法,这些方法未能适当地考虑数据聚合,导致系统性估计误差。
- 提供一种可扩展且精确的推断方法,适用于金融市场的实际应用、社交媒体分析以及地震学等场景,其中高精度时间戳不切实际。
- 通过在不同聚合水平和参数配置下进行广泛的模拟研究,验证该方法的有效性。
提出的方法
- 本文提出了蒙特卡洛期望最大化(MC-EM)算法,以处理因霍克斯过程中数据聚合而导致的似然函数计算不可行的问题。
- 在E步中,算法使用提议分布 q(𝒯*|N, Θ^i) 在每个分箱内抽样未观测到的事件时间,以最大化所采样配置的似然。
- 在M步中,通过真实密度与提议密度之比得到的权重,最大化完整数据对数似然的加权平均。
- 该方法同时处理指数型和幂律型激发核,后者需对正则化核形式进行仔细处理,以确保过程的平稳性。
- 算法使用截断的条件强度函数来建模分箱内事件时间的似然,以考虑先前事件带来的自激发效应。
- 通过优化约束确保分支比率 γ < 1,从而保持过程的平稳性。
实验结果
研究问题
- RQ1蒙特卡洛EM算法能否有效从聚合的、分箱的事件数据中恢复霍克斯过程的真实参数?
- RQ2在数据聚合条件下,所提出的MC-EM方法与现有估计技术相比,在偏差和方差方面表现如何?
- RQ3分箱宽度和聚合水平对自激发点过程参数估计精度有何影响?
- RQ4MC-EM方法在不同激发核形式(如指数衰减和幂律衰减)下是否保持鲁棒性?
- RQ5在实际应用中,忽略数据聚合在多大程度上会导致系统性估计误差?
主要发现
- 在所有测试的聚合水平和参数配置下,所提出的MC-EM算法相较于现有方法显著降低了参数估计的偏差和方差。
- 现有方法在应用于分箱数据时,特别是在粗粒度分箱下,产生了严重偏差且估计值高度可变。
- MC-EM方法在大分箱宽度下仍能实现一致收敛并保持低估计误差,表现出对数据聚合的高度鲁棒性。
- 对于幂律核,该方法正确施加了平稳性条件 α < c,确保了过程动力学的有效性。
- 通过全面的模拟研究验证,该算法能高精度地恢复背景强度 ν、激发幅度 α 和衰减率 β。
- 在M步中使用基于重要性采样的加权似然,实现了对不可行完整数据似然的准确近似。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。