Skip to main content
QUICK REVIEW

[论文解读] Testing for a Change in Mean After Changepoint Detection

Sean Jewell, Paul Fearnhead|arXiv (Cornell University)|Oct 9, 2019
Metabolomics and Mass Spectrometry Studies被引用 4
一句话总结

本文提出了一种选择性推断框架,用于检验在估计的变点周围均值是否发生变化,仅基于变点的局部邻域进行条件推断,而非整个估计的变点集合。该方法可对通过二元分割、ℓ₀分割或融合lasso检测到的变点进行有效且统计功效较高的假设检验,计算高效,并在误差方差未知时仍能正确控制第一类错误率。

ABSTRACT

While many methods are available to detect structural changes in a time series, few procedures are available to quantify the uncertainty of these estimates post-detection. In this work, we fill this gap by proposing a new framework to test the null hypothesis that there is no change in mean around an estimated changepoint. We further show that it is possible to efficiently carry out this framework in the case of changepoints estimated by binary segmentation and its variants, $\ell_{0}$ segmentation, or the fused lasso. Our setup allows us to condition on much less information than existing approaches, which yields higher powered tests. We apply our proposals in a simulation study and on a dataset of chromosomal guanine-cytosine content. These approaches are freely available in the R package ChangepointInference at https://jewellsean.github.io/changepoint-inference/.

研究动机与目标

  • 为广泛使用的变点估计方法(如二元分割和ℓ₀分割)解决缺乏统计推断工具的问题。
  • 开发一种框架,用于检验估计变点周围的均值是否发生变化,重点在于变化的大小而非其精确位置。
  • 通过仅基于最小充分信息(即变点及其相邻点)进行条件推断,而非整个估计的变点集合,实现有效的假设检验并正确控制第一类错误率。
  • 将框架扩展至处理未知误差方差,并支持对均值变化量的置信区间构建。
  • 通过利用常见变点检测方法的结构特征,开发计算高效的算法实现。

提出的方法

  • 该方法使用选择性推断来检验原假设 H₀: νᵀμ = 0,其中 ν 是捕捉候选变点周围均值差异的对比向量。
  • 通过条件事件 {τ̂_{j-1}, τ̂_j, τ̂_{j+1}} ⊆ M(y′(ϕ)) 来定义检验统计量的选择性分布,即第 j 个估计变点及其相邻变点被包含在模型中的事件。
  • p 值通过计算 Pr(|νᵀy| ≥ |νᵀy| | 条件事件) 得到,利用了在高斯误差下 νᵀY 与正交补空间上的投影相互独立的性质。
  • 通过利用递归结构和动态规划,为二元分割和ℓ₀分割开发了高效算法,以计算条件集合和 p 值。
  • 对于融合lasso,该方法通过利用解路径的分段常数结构以及lasso路径下的条件分布,对框架进行适配。
  • 即使误差方差 σ² 未知,该方法依然有效,通过在检验统计量中使用一致估计量(如一阶差分的中位数绝对偏差)来实现。

实验结果

研究问题

  • RQ1我们能否为通过二元分割或ℓ₀分割等常用方法估计的变点周围的均值变化构建有效的假设检验?
  • RQ2仅基于局部变点邻域(而非完整的模型选择路径)进行条件推断,是否能实现更高统计功效并正确控制第一类错误率?
  • RQ3该框架能否扩展以处理未知误差方差,同时保持有效的统计推断?
  • RQ4该方法在计算上是否足够高效,可应用于大规模时间序列数据?
  • RQ5该框架能否适配其他模型,例如钙成像数据中的尖峰检测?

主要发现

  • 通过在检验统计量中使用 σ 的一致估计量,所提框架即使在误差方差未知时,也能在原假设下实现正确的第一类错误率控制。
  • 通过仅基于最小信息(即估计的变点及其两个邻点)进行条件推断,该方法保持了较高的统计功效,避免了因对整个模型选择路径进行条件推断而带来的保守性。
  • 该框架计算高效且可扩展,其算法利用了二元分割和ℓ₀分割的递归结构,可在 O(T) 时间内为每个变点计算 p 值。
  • 模拟研究显示,该方法在原假设下保持了适当的第一类错误率,并在备择假设下表现出显著的统计功效,即使在存在多个紧密相邻变点的情况下亦然。
  • 该方法成功应用于染色体鸟嘌呤-胞嘧啶含量数据集,展示了其在真实世界基因组学应用中的实际效用。
  • 该方法已实现于 R 包 ChangepointInference 中,便于在应用研究中广泛使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。