Skip to main content
QUICK REVIEW

[论文解读] Performance of information criteria used for model selection of Hawkes process models of financial data

J. M. Chen, Alan G. Hawkes|arXiv (Cornell University)|Feb 20, 2017
Point processes and geometric inequalities被引用 4
一句话总结

本研究评估了AIC、BIC和HQ信息准则在高频率金融数据中选择混合指数核的Hawkes过程阶数时的性能。通过使用真实参数集和样本量的蒙特卡洛模拟,发现AIC在小样本中优于BIC和HQ,而一致准则(BIC、HQ)在大样本中几乎达到100%的正确模型选择率,尽管AIC的正确率随样本量增加呈现非单调变化。

ABSTRACT

We test three common information criteria (IC) for selecting the order of a Hawkes process with an intensity kernel that can be expressed as a mixture of exponential terms. These processes find application in high-frequency financial data modelling. The information criteria are Akaike's information criterion (AIC), the Bayesian information criterion (BIC) and the Hannan-Quinn criterion (HQ). Since we work with simulated data, we are able to measure the performance of model selection by the success rate of the IC in selecting the model that was used to generate the data. In particular, we are interested in the relation between correct model selection and underlying sample size. The analysis includes realistic sample sizes and parameter sets from recent literature where parameters were estimated using empirical financial intra-day data. We compare our results to theoretical predictions and similar empirical findings on the asymptotic distribution of model selection for consistent and inconsistent IC.

研究动机与目标

  • 评估AIC、BIC和HQ在选择具有混合指数强度核的Hawkes过程正确模型阶数时的性能。
  • 研究在真实金融数据设定下,模型选择准确性如何随样本量变化。
  • 将实证结果与信息准则的一致性和渐近行为的理论预测进行比较。
  • 评估在不同参数配置和从真实日内金融数据中抽取的样本量下,信息准则的稳健性。
  • 考察模型选择成功率中是否存在非单调行为,特别是AIC的表现。

提出的方法

  • 使用薄化算法模拟Hawkes过程,其强度核为最多三个指数项的加权和。
  • 使用MATLAB中的fmincon优化程序通过最大似然估计(MLE)估计模型参数。
  • 利用MLE得到的对数似然值,计算每个候选模型阶数的AIC、BIC和HQ值。
  • 在多个样本量(T = 500至T = 21,600)和两组真实参数集下,进行重复模拟的蒙特卡洛实验。
  • 将模型选择成功率定义为信息准则选择出真实数据生成模型阶数的模拟比例。
  • 通过模拟中参数估计的均方根误差(RMSE)评估估计精度。

实验结果

研究问题

  • RQ1在小到中等样本量下,AIC、BIC和HQ在选择具有混合指数核的Hawkes过程正确模型阶数时表现如何?
  • RQ2AIC、BIC和HQ的模型选择成功率是否随样本量单调增加,还是存在非单调模式?
  • RQ3信息准则的表现与关于一致性和渐近行为的理论预期相比如何?
  • RQ4参数估计误差(RMSE)在多大程度上影响模型选择精度,特别是对高阶分量的影响?
  • RQ5在小样本设定下,AICc/AIC组合规则是否比单独使用AIC更有效?

主要发现

  • 在小样本(T = 500)下,AIC在模型选择中成功率最高,优于BIC和HQ,这与AIC的不一致性和倾向于过拟合的特性一致。
  • BIC和HQ的模型选择成功率随样本量增加而单调提升,在T = 2000时已接近100%的正确选择率。
  • AIC表现出非单调的成功率模式,在T ≈ 1800附近出现性能下降,表明在中等样本量下可能存在过拟合倾向。
  • 在大样本(T ≥ 3600)下,一致信息准则(BIC和HQ)的正确模型选择率超过90%,在T = 21,600时两者均接近100%。
  • 在T = 21,600时,AIC的成功率略有下降至约94%,有6%的概率高估模型阶数,表明其倾向于选择过于复杂的模型。
  • 在较小样本(T = 600, 900)下,参数估计的RMSE较高,特别是对第二个指数分量,但随着样本量增加,RMSE显著降低,从而提高了模型选择的准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。