Skip to main content
QUICK REVIEW

[论文解读] Detecting Abrupt Changes in the Presence of Local Fluctuations and Autocorrelated Noise

Gaetano Romano, Guillem Rigaill|arXiv (Cornell University)|May 4, 2020
Gene expression and cancer classification参考文献 57被引用 34
一句话总结

本文提出 DeCAFS,一种新颖的动态规划算法,通过将局部均值波动建模为随机游走过程,并将自相关噪声建模为 AR(1) 过程,实现对单变量时间序列中突变点的检测。通过最小化带有 BIC 惩罚项的惩罚似然代价函数,DeCAFS 在存在自相关性和局部波动的真实条件下,相较于现有方法在检测真实突变点方面表现更优,其有效性已在测井数据和细菌基因表达数据上得到验证。

ABSTRACT

Whilst there are a plethora of algorithms for detecting changes in mean in univariate time-series, almost all struggle in real applications where there is autocorrelated noise or where the mean fluctuates locally between the abrupt changes that one wishes to detect. In these cases, default implementations, which are often based on assumptions of a constant mean between changes and independent noise, can lead to substantial over-estimation of the number of changes. We propose a principled approach to detect such abrupt changes that models local fluctuations as a random walk process and autocorrelated noise via an AR(1) process. We then estimate the number and location of changepoints by minimising a penalised cost based on this model. We develop a novel and efficient dynamic programming algorithm, DeCAFS, that can solve this minimisation problem; despite the additional challenge of dependence across segments, due to the autocorrelated noise, which makes existing algorithms inapplicable. Theory and empirical results show that our approach has greater power at detecting abrupt changes than existing approaches. We apply our method to measuring gene expression levels in bacteria.

研究动机与目标

  • 解决标准突变点检测方法在数据呈现自相关噪声和局部均值波动时性能不佳的问题。
  • 开发一种能同时考虑自相关性和局部均值漂移的严谨统计模型。
  • 设计一种高效的动态规划算法,能够在该复杂模型下精确最小化惩罚代价。
  • 在真实世界数据上评估该方法的性能,特别是在基因表达分析中,其中突变和渐变漂移均具有生物学意义。
  • 证明当模型存在误设时,DeCAFS 仍能提供比现有方法更准确、更稳健的突变点检测结果。

提出的方法

  • 将局部均值波动建模为随机游走过程,将测量噪声建模为 AR(1) 过程。
  • 基于完整模型的对数似然加上每个突变点的 BIC 惩罚项,定义惩罚代价函数。
  • 开发 DeCAFS,一种新颖的动态规划算法,通过扩展函数剪枝方法以处理因 AR(1) 噪声导致的段间依赖性。
  • 通过预处理步骤估计模型参数,包括从数据中 k-滞后差分估计方差和自相关性。
  • 应用函数剪枝方法,高效计算在完整模型下的最优分段。
  • 基于理论结果采用惩罚项膨胀策略,以在模型误差下保持一致性。

实验结果

研究问题

  • RQ1能否通过联合考虑局部均值波动和自相关噪声的模型,提升真实时间序列中突变点检测的性能?
  • RQ2与野生二元分割法和 AR1Seg 等现有方法相比,DeCAFS 在准确性和鲁棒性方面表现如何?
  • RQ3使用基于完整似然的惩罚代价函数并结合 BIC 惩罚项,是否比近似方法或启发式惩罚项具有更强的检测能力?
  • RQ4当模型存在轻微误设时,DeCAFS 是否仍能保持对突变点数量和位置的一致估计?
  • RQ5在细菌基因表达等真实生物数据上,DeCAFS 表现如何,其中突变和渐变漂移均具有生物学意义?

主要发现

  • 与标准方法相比,DeCAFS 显著降低了过拟合:在测井数据上,使用默认惩罚值时检测到 10 个突变点,而使用标准准则的野生二元分割法检测到 25 个,AR(1) 惩罚项膨胀方法检测到 18 个。
  • 在检测终止子时,DeCAFS 与 hmmTiling 相比更接近生物真实情况,所有阈值 δ 下的 M(δ) 值均更优。
  • 在启动子检测中,DeCAFS 在低阈值下与 hmmTiling 表现相当,但在高阈值下表现更优,表明其对噪声更具鲁棒性。
  • 在测井数据上,DeCAFS 使用默认惩罚值检测到 10 个突变点,与专家对岩层过渡的解释高度一致。
  • 在细菌基因表达数据上,DeCAFS 在约 7 分钟内处理了 192,000 个数据点,显著优于 hmmTiling 对两条链分别耗时 5 小时 36 分钟的运行时间。
  • 理论分析证实,只要惩罚项适当膨胀,DeCAFS 即使在模型误设下也能保持突变点估计的一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。