Skip to main content
QUICK REVIEW

[论文解读] Structure-Adaptive Sequential Testing for Online False Discovery Rate Control

Bowen Gang, Wenguang Sun|arXiv (Cornell University)|Feb 28, 2020
Statistical Methods in Clinical Trials参考文献 23被引用 4
一句话总结

本文提出结构自适应顺序检验(SAST),一种新颖的在线错误发现率(FDR)控制方法,通过基于条件局部错误发现率(Clfdr)动态分配alpha财富,以适应时变数据结构。通过利用局部信号模式和自适应alpha投资规则,SAST在保持严格FDR控制的同时,显著提升了统计功效,相较于现有在线方法,在真实世界时间序列和基因组数据集上的实验结果已验证其优越性。

ABSTRACT

Consider the online testing of a stream of hypotheses where a real--time decision must be made before the next data point arrives. The error rate is required to be controlled at {all} decision points. Conventional \emph{simultaneous testing rules} are no longer applicable due to the more stringent error constraints and absence of future data. Moreover, the online decision--making process may come to a halt when the total error budget, or alpha--wealth, is exhausted. This work develops a new class of structure--adaptive sequential testing (SAST) rules for online false discover rate (FDR) control. A key element in our proposal is a new alpha--investment algorithm that precisely characterizes the gains and losses in sequential decision making. SAST captures time varying structures of the data stream, learns the optimal threshold adaptively in an ongoing manner and optimizes the alpha-wealth allocation across different time periods. We present theory and numerical results to show that the proposed method is valid for online FDR control and achieves substantial power gain over existing online testing rules.

研究动机与目标

  • 解决现有在线FDR控制方法缺乏对时变数据结构的适应性,且因刚性错误分配导致功效损失的局限性。
  • 开发一种顺序检验框架,在缺乏未来数据且alpha财富有限的情况下,仍能在每个决策点保持严格的FDR控制。
  • 通过学习最优阈值并利用局部信号模式(如聚类和稀疏性)来优化alpha财富在时间上的分配。
  • 通过防止因alpha财富耗尽而导致的过早终止,实现持续的发现能力。
  • 将领域特定的结构信息(如信号分组和幅度趋势)整合到决策过程中,以提升统计功效。

提出的方法

  • 提出一种新型alpha投资算法,精确建模顺序检验中的收益与损失,实现基于观测数据结构的alpha财富动态再分配。
  • 采用条件局部错误发现率(Clfdr)作为关键统计量,以捕捉时变信号模式并指导拒绝决策。
  • 使用STL分解去除时间序列数据中的趋势和季节成分,随后利用两组分正态混合模型对残差建模,以估计经验零分布。
  • 基于Clfdr实施数据驱动的阈值规则,自适应选择反映局部信号强度和结构的拒绝阈值。
  • 实施预热阶段和基于邻域的平滑处理,以稳定在线测试早期阶段的Clfdr估计。
  • 将Clfdr统计量与广义alpha投资框架结合,确保FDR控制的有效性,同时最大化发现功效。

实验结果

研究问题

  • RQ1能否通过适应局部数据结构(如信号聚类和稀疏性)来提升在线FDR控制的统计功效?
  • RQ2如何在时间维度上动态分配alpha财富,以在保持FDR控制的同时最大化发现产量?
  • RQ3与基于标准p值的方法相比,条件局部错误发现率(Clfdr)在顺序检验中能在多大程度上提升检测功效?
  • RQ4结构自适应方法能否防止因alpha财富耗尽而导致的在线测试过早终止?
  • RQ5在具有流数据的现实应用场景中,所提出的SAST方法与离线方法及现有在线FDR程序相比表现如何?

主要发现

  • 在纽约市出租车数据集中,SAST在FDR水平0.0001下检测到201个异常点,优于离线BH程序(179次发现)及其他在线方法。
  • 在IMPC基因型数据集中,SAST在FDR水平0.05下实现12,975次发现,超过离线BH程序(12,907次)及所有其他在线方法。
  • SAST.DD变体在发现数量上优于LORD++(8,517次发现)、LOND(2,905次)和固定阈值方法(4,158次),展现出更强的鲁棒性与适应性。
  • 该方法成功捕捉了时间序列数据中的聚类异常,其中信号模式中的结构信息显著提升了检测能力,超越了仅依赖p值的检测效果。
  • Clfdr的使用使局部数据结构得到更优利用,从而在不违反FDR控制的前提下提升了统计功效,即使在高维流数据环境中亦表现优异。
  • SAST在所有决策点均保持了有效的FDR控制,并通过基于信号强度和结构的智能alpha财富再投资,避免了过早终止。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。