Skip to main content
QUICK REVIEW

[论文解读] Goodness-of-Fit Test for Mismatched Self-Exciting Processes

Wei Song, Shixiang Zhu|arXiv (Cornell University)|Jun 16, 2020
Statistical Mechanics and Entropy被引用 1
一句话总结

本文提出了一种新颖的拟合优度(GOF)检验方法,用于自激发点过程的生成模型,采用非参数化、自归一化的广义得分(GS)统计量。通过利用准最大似然估计理论,该方法显式考虑了模型误设问题,并建立了渐近有效性,从而在真实过程未知的情况下,也能实现对神经网络模型的可靠评估。

ABSTRACT

Recently there have been many research efforts in developing generative models for self-exciting point processes, partly due to their broad applicability for real-world applications. However, rarely can we quantify how well the generative model captures the nature or ground-truth since it is usually unknown. The challenge typically lies in the fact that the generative models typically provide, at most, good approximations to the ground-truth (e.g., through the rich representative power of neural networks), but they cannot be precisely the ground-truth. We thus cannot use the classic goodness-of-fit (GOF) test framework to evaluate their performance. In this paper, we develop a GOF test for generative models of self-exciting processes by making a new connection to this problem with the classical statistical theory of Quasi-maximum-likelihood estimator (QMLE). We present a non-parametric self-normalizing statistic for the GOF test: the Generalized Score (GS) statistics, and explicitly capture the model misspecification when establishing the asymptotic distribution of the GS statistic. Numerical simulation and real-data experiments validate our theory and demonstrate the proposed GS test's good performance.

研究动机与目标

  • 为解决当真实数据生成过程未知时,自激发点过程生成模型缺乏可靠评估方法的问题。
  • 克服经典GOF检验在生成模型仅为近似时的局限性,后者假设真实模型已知。
  • 开发一种统计上有效的GOF检验,以考虑神经网络点过程模型中固有的模型误设问题。
  • 利用准最大似然估计理论,建立所提检验统计量在模型误设下的渐近分布。
  • 通过模拟和真实数据验证方法的性能,证明其可靠性和检验效能。

提出的方法

  • 提出一种非参数化、自归一化的广义得分(GS)统计量,作为自激发点过程拟合优度的检验方法。
  • 通过将其与准最大似然估计器(QMLE)理论相联系,建立GS统计量在模型误设下的渐近分布。
  • 利用自激发过程的准对数似然函数的得分函数,构造GS检验统计量。
  • 应用自归一化技术以稳定检验统计量,避免对未知方差参数的依赖。
  • 推导在正确模型设定原假设下GS统计量的极限分布,即使在模型误设时也成立。
  • 通过数值模拟和真实数据实验,验证GS检验的理论性质和性能表现。

实验结果

研究问题

  • RQ1当真实数据生成过程未知或未观测到时,能否为自激发点过程的生成模型开发一种拟合优度检验?
  • RQ2在点过程的GOF检验统计量渐近分布中,如何正式考虑模型误设的影响?
  • RQ3所提出的广义得分(GS)统计量在自激发过程中,是否在模型误设下仍保持有效的大小和检验效能?
  • RQ4GS检验能否在合成数据和真实世界数据中可靠地区分设定良好与设定错误的生成模型?
  • RQ5在真实过程未知的场景下,所提出的方法与经典GOF框架相比表现如何?

主要发现

  • 所提出的广义得分(GS)统计量在模型误设下实现了渐近有效性,使得即使生成模型并非真实数据生成过程,也能实现可靠的GOF检验。
  • 在数值模拟中,GS检验保持了正确的大小,并展现出良好的检验效能,证明其对模型误设具有鲁棒性。
  • 该方法通过使用准最大似然估计理论推导出的渐近分布,成功捕捉了模型误设的影响。
  • 真实世界数据的实证结果表明,GS检验能够检测出生成模型与观测点过程数据之间的显著差异。
  • GS统计量中的自归一化技术确保了统计量的稳定性,避免了对未知方差参数的依赖,从而增强了实际可用性。
  • 理论框架为在真实数据不可观测的场景下,对自激发点过程的生成模型提供了系统化的评估方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。