[论文解读] False Discovery Rate Control via Data Splitting
本文提出了一种用于高维特征选择中错误发现率(FDR)控制的数据分割框架,利用回归系数的独立估计以确保原假设下对称性。多重数据分割(MDS)可稳定选择过程、提升统计功效,并降低错误发现比例的方差,在线性模型和高斯图形模型中实现渐近FDR控制,且对分布假设要求极低。
Selecting relevant features associated with a given response variable is an important problem in many scientific fields. Quantifying quality and uncertainty of a selection result via false discovery rate (FDR) control has been of recent interest. This article introduces a data-splitting method (referred to as “DS”) to asymptotically control the FDR while maintaining a high power. For each feature, DS constructs a test statistic by estimating two independent regression coefficients via data splitting. FDR control is achieved by taking advantage of the statistic’s property that, for any null feature, its sampling distribution is symmetric about zero; whereas for a relevant feature, its sampling distribution has a positive mean. Furthermore, a Multiple Data Splitting (MDS) method is proposed to stabilize the selection result and boost the power. Surprisingly, with the FDR under control, MDS not only helps overcome the power loss caused by data splitting, but also results in a lower variance of the false discovery proportion (FDP) compared with all other methods in consideration. Extensive simulation studies and a real-data application show that the proposed methods are robust to the unknown distribution of features, easy to implement and computationally efficient, and are often the most powerful ones among competitors especially when the signals are weak and correlations or partial correlations among features are high. Supplementary materials for this article are available online.
研究动机与目标
- 为在特征分布假设最少的前提下控制高维特征选择中的错误发现率(FDR)提供解决方案。
- 克服高维推断中通常因数据分割导致的统计功效损失。
- 开发一种稳健且计算高效的FDR控制方法,即使在高相关性和弱信号条件下也能保持高统计功效。
- 将FDR控制扩展至特征联合分布未知或复杂的场景。
- 提供一种易于实现的框架,可使用标准高维回归工具,且无需了解特征的真实条件分布。
提出的方法
- 将数据分为两个独立部分:一部分用于特征选择(例如通过Lasso),另一部分用于估计检验统计量(例如在剩余数据上使用OLS)。
- 对每个特征,计算检验统计量,即通过不同数据分割独立获得的两个回归系数估计值之间的差异。
- 利用原假设下检验统计量抽样分布的对称性(即原假设特征下关于零对称)以实现FDR控制。
- 通过多次重复数据分割和选择过程,并聚合结果,实现多重数据分割(MDS),以稳定选择并提升功效。
- 对聚合后的检验统计量使用Benjamini-Hochberg程序(BHq)以在预设水平下控制FDR。
- 通过依赖原假设下系数估计的渐近正态性和独立性,确保理论上的FDR控制。
实验结果
研究问题
- RQ1能否使用数据分割策略在高维线性和高斯图形模型中渐近控制FDR?
- RQ2与单次分割方法相比,多重数据分割(MDS)是否能降低错误发现比例(FDP)的方差?
- RQ3当信号微弱且特征高度相关时,所提出的方法能否保持高统计功效?
- RQ4当特征联合分布未知或错误指定时,该方法在实际中表现如何?
- RQ5该框架能否扩展至非线性模型或复杂数据类型(如图像和自然语言)?
主要发现
- 所提出的数据显示分割方法在低维和高维线性模型及高斯图形模型中,可对任意指定水平渐近控制FDR。
- 与所有其他方法(包括单次分割和knockoff过滤)相比,MDS显著降低了错误发现比例(FDP)的方差。
- MDS在高相关性和弱信号条件下显著提升了统计功效,在多种模拟和真实数据设置中优于BHq、knockoff过滤和DeepPINK。
- 在一项真实世界的HIV耐药性研究中,MDS在七种蛋白酶抑制剂(PI)药物中的五种以及六种核苷类逆转录酶抑制剂(NRTI)药物中的四种中,发现了比竞争方法更多的真实突变,尤其在DDI和TDF等药物上表现更优。
- 该方法对未知特征分布具有鲁棒性,且无需了解特征的联合分布,这与model-X knockoff过滤不同。
- 该框架计算高效,可使用标准高维回归软件轻松实现,具有良好的实际可应用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。