[论文解读] False Discovery Rate Control Under General Dependence By Symmetrized Data Aggregation
本文提出了一种无分布假设的多重假设检验程序——对称数据聚合(SDA),用于在一般依赖结构下控制错误发现率(FDR)。通过利用样本分割、数据筛选和信息聚合,SDA 构建了对称的排名统计量和数据驱动的阈值,实现了对 FDR 的稳健控制,并在功效上优于现有方法(如 knockoffs 和 BH),尤其在中等到强依赖条件下表现更优。
We develop a new class of distribution-free multiple testing rules for false discovery rate (FDR) control under general dependence. A key element in our proposal is a symmetrized data aggregation (SDA) approach to incorporating the dependence structure via sample splitting, data screening, and information pooling. The proposed SDA filter first constructs a sequence of ranking statistics that fulfill global symmetry properties, and then chooses a data-driven threshold along the ranking to control the FDR. The SDA filter substantially outperforms the Knockoff method in power under moderate to strong dependence, and is more robust than existing methods based on asymptotic <i>p</i>-values. We first develop finite-sample theories to provide an upper bound for the actual FDR under general dependence, and then establish the asymptotic validity of SDA for both the FDR and false discovery proportion control under mild regularity conditions. The procedure is implemented in the R package sdafilter. Numerical results confirm the effectiveness and robustness of SDA in FDR control and show that it achieves substantial power gain over existing methods in many settings.
研究动机与目标
- 开发一种在多重检验中具有鲁棒性、无分布假设的 FDR 控制方法,适用于一般依赖结构。
- 解决现有 FDR 程序(如 BH 和 knockoffs)的局限性,这些程序通常假设独立性或依赖渐近近似。
- 通过非参数、数据驱动的方法整合依赖信息,提升统计功效,同时避免强参数假设。
- 在较弱正则性条件下,为 FDR 和错误发现比例(FDP)控制建立有限样本和渐近理论保证。
- 通过 R 包 sdafilter 提供实用实现,便于在基因组学及其他高维场景中实际应用。
提出的方法
- 使用样本分割将数据划分为训练集和验证集,以在不同分割中实现检验统计量的对称性。
- 通过平均两个数据分割中的检验统计量,构建对称化排名统计量,确保全局对称性,从而增强鲁棒性。
- 在信息聚合前应用数据筛选,以过滤弱信号并减少噪声。
- 通过跨多个分割聚合信息,提升信噪比并稳定 FDR 估计。
- 沿对称化统计量的排名选择数据驱动的阈值,以在名义水平下控制 FDR。
- 采用非参数估计错误发现比例(FDP),避免依赖渐近正态性或参数模型。
实验结果
研究问题
- RQ1在不假设独立性或渐近正态性的情况下,能否实现一般依赖下的 FDR 控制?
- RQ2如何有效利用依赖结构以提升多重检验中的统计功效?
- RQ3在依赖条件下,FDR 控制的有限样本行为如何?能否建立严格的上界?
- RQ4在中等到强依赖条件下,SDA 方法与 knockoff 和 BH 程序相比,在功效和鲁棒性方面表现如何?
- RQ5在较弱正则性条件下,非参数、数据驱动的方法能否实现 FDR 和 FDP 控制的渐近有效性?
主要发现
- SDA 滤波器在任意依赖结构下实现了有限样本的 FDR 控制,实际 FDR 的上界通过中偏差理论得以建立。
- 在中等到强依赖条件下,SDA 显著优于 knockoff 方法的功效,尤其在高维设定中表现突出。
- R-SDA 变体(采用重复样本分割)在 FDP 和 AP 估计中表现出比单次分割 SDA 更低的变异性,性能更稳定。
- SDA 在不同样本大小和检验数量下均保持准确的 FDR 控制,即使在估计协方差矩阵时也表现优异,优于 PFA 和 DATE 在小样本情形下的表现。
- 在 B 系谱 ALL 基因表达真实数据分析中,SDA 识别出 19 个差异表达的探针集,其一致性与功效高于 BH、SS、PFA 和 DATE。
- 数值结果证实,SDA 对正态性违反和模型误设具有鲁棒性,无论依赖结构如何,FDR 控制均接近名义水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。