[论文解读] Controlling False Discovery Rate Using Gaussian Mirrors
本文提出高斯镜像(Gaussian Mirror, GM)方法,通过高斯扰动生成镜像变量,在高维线性回归中控制错误发现率(FDR)。该方法在弱依赖假设下可在任意指定水平实现FDR控制,并展现出优越统计功效,尤其在高相关性和非稀疏设计下优于现有方法,包括 knockoff 滤波器。
Simultaneously finding multiple influential variables and controlling the false discovery rate (FDR) for linear regression models is a fundamental problem. We here propose the Gaussian Mirror (GM) method, which creates for each predictor variable a pair of mirror variables by adding and subtracting a randomly generated Gaussian perturbation, and proceeds with a certain regression method, such as the ordinary least-square or the Lasso (the mirror variables can also be created after selection). The mirror variables naturally lead to test statistics effective for controlling the FDR. Under a mild assumption on the dependence among the covariates, we show that the FDR can be controlled at any designated level asymptotically. We also demonstrate through extensive numerical studies that the GM method is more powerful than many existing methods for selecting relevant variables subject to FDR control, especially for cases when the covariates are highly correlated and the influential variables are not overly sparse.
研究动机与目标
- 解决在高维线性回归中同时选择显著变量并控制错误发现率(FDR)的挑战。
- 开发一种方法,在预测变量高度相关且真实信号非稀疏时仍能保持强FDR控制。
- 提供一种计算上可行且功效强大的现有FDR控制方法(如 knockoffs 和 model-X knockoffs)的替代方案。
- 通过神经高斯镜像(NGM)变体将该方法扩展至非线性模型,如神经网络。
提出的方法
- 对每个预测变量,通过添加和减去一个均值为零、尺度经仔细选择的高斯扰动,生成两个镜像变量。
- 使用镜像变量上回归系数的符号差异作为检验统计量,以评估变量重要性。
- 通过在分位数处对镜像统计量进行阈值化,控制FDR,确保期望FDP被限制在名义水平q以内。
- 利用镜像变量在原假设下的对称性和可交换性,确保渐近FDR控制的有效性。
- 将该方法应用于线性模型和神经网络,后者通过影响度量计算镜像统计量。
- 在神经网络应用中,使用非参数条件互信息度量选择最优扰动尺度。
实验结果
研究问题
- RQ1是否存在一种简单、数据驱动的方法,可在不依赖强分布假设或完整协变量分布知识的前提下,控制高维线性回归中的FDR?
- RQ2在高相关性和非稀疏设计下,GM方法与 knockoff 滤波器及 model-X knockoffs 相比表现如何?
- RQ3GM框架能否推广至非线性模型(如神经网络),同时保持FDR控制并维持高统计功效?
- RQ4在协变量弱依赖假设下,FDR控制的理论依据是什么?
- RQ5扰动尺度的选择如何影响有限样本下的统计功效和FDR控制?
主要发现
- 在协变量的弱依赖假设下,GM方法可渐近地在任意预设水平q控制FDR。
- 在高相关性设置下,GM方法显著优于现有方法,尤其当真实信号非稀疏时功效更高。
- 对于神经网络模型,NGM变体将FDR控制在名义水平以下(q=0.1),且在多项式链接函数下功效优于DeepPINK。
- 在p=2000且f3(t)=0.1t^5的模拟中,NGM实现53.0%的功效,而DeepPINK下降至5.3%,表明NGM对非线性具有更强鲁棒性。
- 即使协变量联合分布未知,该方法仍能保持FDR控制,避免了model-X knockoffs等方法对强建模假设的依赖。
- 理论分析证实,期望FDP收敛至名义水平,且在弱条件下渐近保持FDR控制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。