[论文解读] Rate optimal multiple testing procedure in high-dimensional regression
该论文提出了一种针对稀有且微弱信号的高维线性回归中的单变量惩罚检验(UPT)方法,此时选择一致性不可行。通过将UPS框架适配至具有加权汉明损失的多重检验,UPT渐近地控制了边际错误发现率(mFDR),并实现了边际错误非发现率(mFNR)的最优收敛速率,在稀疏、微弱信号环境下,其统计功效和误差控制性能优于BH和BY程序。
In the high dimensional regression analysis when the number of predictors is much larger than the sample size, an important question is to select the important variable which are relevant to the response variable of interest. Variable selection and the multiple testing are both tools to address this issue. However, there is little discussion on the connection of these two areas. When the signal strength is strong enough such that the selection consistency is achievable, it seems to be unnecessary to control the false discovery rate. In this paper, we consider the regime where the signals are both rare and weak such that the selection consistency is not achievable and propose a method which controls the false discovery rate asymptotically. It is theoretically shown that the false non-discovery rate of the proposed method converges to zero at the optimal rate. Numerical results are provided to demonstrate the advantage of the proposed method.
研究动机与目标
- 解决在高维回归中存在稀有且微弱信号时,选择一致性失效背景下多重检验缺乏最优性理论的问题。
- 开发一种在微弱信号条件下控制边际错误发现率(mFDR)并最小化边际错误非发现率(mFNR)的方法。
- 通过构建对第一类与第二类错误处理不均等的加权汉明损失,弥合变量选择与多重检验之间的差距。
- 在mFDR控制下建立mFNR收敛速率的理论下界,并证明UPT实现了该最优速率。
- 在多种设计下,通过功效和误差率控制指标,证明UPT在性能上优于BH、BY和UPT*。
提出的方法
- 通过使用对假发现和非发现行为施加不同惩罚的加权汉明损失函数,将单变量惩罚筛选(UPS)方法适配至多重检验。
- 引入一种基于t统计量的数据驱动权重估计程序,以平衡第一类与第二类错误之间的权衡。
- 将检验决策表述为最小化加权汉明误差,从而导出基于检验统计量和估计权重的阈值规则。
- 证明UPT程序在渐近意义上将mFDR控制在水平α,并在稀有/微弱模型下实现了mFNR的最优收敛速率。
- 采用非渐近分析框架,推导有限样本性能边界,并在非高斯设计下验证其稳健性。
- 实施两阶段估计:首先通过预处理步骤估计权重,然后应用阈值规则筛选显著预测变量。
实验结果
研究问题
- RQ1在高维回归中存在稀有且微弱信号时,固定边际错误发现率(mFDR)约束下,边际错误非发现率(mFNR)的最优可实现收敛速率是什么?
- RQ2能否构建一种多重检验程序,使其在保持mFDR控制的同时实现该最优mFNR收敛速率?
- RQ3在稀疏、微弱信号环境下,与BH和BY等现有程序相比,所提方法在功效和误差率控制方面表现如何?
- RQ4当设计矩阵为重尾或非正态分布时,该方法是否仍具有稳健性,特别是在非高斯设计下?
- RQ5该方法的理论最优性是否可在非渐近框架下建立?其必要技术条件是什么?
主要发现
- 在所有模拟设置下,包括非高斯设计,UPT方法均将边际错误发现率(mFDR)控制在名义水平α,而BH和BY未能维持此控制。
- 在实验4的非高斯设计下,当τp=8时,UPT的平均真正发现数(atp)达到37.15,高于BH的31.48,功效提升5.67。
- 当UPT*与BH的mFDR匹配时,UPT*在τp=8时达到47.24个真正发现,而BH仅为31.48,信号发现优势达15.76。
- UPT方法实现了与理论下界一致的mFNR收敛速率,证明其在稀有/微弱信号环境下为率最优。
- 在所有实验中,UPT保持了mFDR控制,其mFDR中位数为0.06–0.07,显著低于BH的0.10–0.20,尤其在弱信号条件下表现更优。
- 该方法对非高斯设计具有稳健性,如实验4所示,即使设计矩阵来自均匀分布,UPT仍保持优异性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。