[论文解读] False Discovery Proportion control for aggregated Knockoffs
该论文提出KOPI,一种新颖的基于敲除法(Knockoff)的方法,通过使用调和平均聚合多个敲除法抽样结果中的π统计量,并结合联合错误率(JER)校准,实现对高维变量选择中假发现比例(FDP)的严格控制。KOPI在脑成像和基因组数据中相较于现有方法展现出显著的统计功效提升,同时确保了结果的可重复性,并避免了对零假设分布的假设。
Controlled variable selection is an important analytical step in various scientific fields, such as brain imaging or genomics. In these high-dimensional data settings, considering too many variables leads to poor models and high costs, hence the need for statistical guarantees on false positives. Knockoffs are a popular statistical tool for conditional variable selection in high dimension. However, they control for the expected proportion of false discoveries (FDR) and not their actual proportion (FDP). We present a new method, KOPI, that controls the proportion of false discoveries for Knockoff-based inference. The proposed method also relies on a new type of aggregation to address the undesirable randomness associated with classical Knockoff inference. We demonstrate FDP control and substantial power gains over existing Knockoff-based methods in various simulation settings and achieve good sensitivity/specificity tradeoffs on brain imaging and genomic data.
研究动机与目标
- 解决标准敲除法方法中缺乏对假发现比例(FDP)控制的问题,这些方法仅控制期望的FDR。
- 降低因每次运行中敲除法随机生成导致的不稳定性与不可重复性。
- 在保持FDP控制的前提下,提升现有基于聚合的敲除法方法的统计功效。
- 开发一种对任意聚合方案具有鲁棒性的方法,且无需对零假设下敲除法统计量的独立同分布行为作假设。
- 在神经影像学和基因组学等高维场景下,实现可靠、可重复且强大的条件变量选择。
提出的方法
- 提出一种新的聚合方案,利用来自多个敲除法抽样结果的π统计量进行调和平均聚合,以增强稳定性和功效。
- 引入联合错误率(JER)框架,推导出FDP的显式上界,从而实现严格的FDP控制。
- 通过二分查找进行校准,以优化拒绝阈值,确保FDP控制的同时最大化统计功效。
- 利用零假设下敲除法统计量的对称性,构建有效的、基于数据的JER上界。
- 应用e-BH程序框架,对从π统计量聚合得到的e值进行处理,实现稳健的FDR控制。
- 利用[17]中提出的π统计量作为变量重要性的排序机制,并在多个敲除法实现中对结果进行聚合。
实验结果
研究问题
- RQ1是否可以在不依赖FDR控制作为代理指标的前提下,实现在基于敲除法推断中的FDP控制?
- RQ2多个敲除法抽样的聚合是否能够同时提升高维变量选择中的可重复性与统计功效?
- RQ3π统计量的调和平均聚合是否相比分位数法或平均法聚合方案具有更高的统计功效?
- RQ4是否可以在不假设零假设下敲除法统计量为独立同分布的前提下实现FDP控制?
- RQ5在真实fMRI和基因组数据集上,与现有基于聚合的敲除法方法相比,所提出方法在功效与FDP控制方面表现如何?
主要发现
- KOPI在所有模拟设置和真实数据应用中(包括脑成像与基因组学)均将FDP控制在名义水平。
- 在半模拟fMRI数据中,KOPI在所有方法中实现了最高的统计功效(中位功效 > 0.8),同时保持了FDP控制,优于所有其他基于敲除法的方法。
- 在79个样本、90个基因的基因组数据集中,KOPI在50次运行中仅选出了8个不同的基因,其中3个基因在100%的运行中被选中,表明其具有高度的稳定性和特异性。
- 原始敲除法在各次运行中选出了24个不同的基因,且无一基因的选择频率超过70%,表明其可重复性差。
- 所有其他基于聚合的方法在该基因组数据集的所有运行中均完全无功效,而KOPI始终保持一致的有效性。
- KOPI的计算时间与经典敲除法聚合方法相当,通常在典型fMRI数据集上仅需数分钟。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。