[论文解读] Selective inference with unknown variance via the square-root LASSO
该论文提出了一种基于平方根LASSO的选择性推断框架,可在模型选择后同时估计回归系数、其置信区间以及误差方差 $σ^2$,即使 $σ^2$ 未知。该方法通过利用平方根LASSO的尺度无关调参特性,消除了对未知噪声水平的依赖,从而提供有效的p值和置信区间,并在模拟中相较于现有方法展现出更优的方差估计性能和稳健的FDR控制能力。
There has been much recent work on inference after model selection when the noise level is known, however, $σ$ is rarely known in practice and its estimation is difficult in high-dimensional settings. In this work we propose using the square-root LASSO (also known as the scaled LASSO) to perform selective inference for the coefficients and the noise level simultaneously. The square-root LASSO has the property that choosing a reasonable tuning parameter is scale-free, namely it does not depend on the noise level in the data. We provide valid p-values and confidence intervals for the coefficients after selection, and estimates for model specific variance. Our estimates perform better than other estimates of $σ^2$ in simulation.
研究动机与目标
- 解决在误差方差 $σ^2$ 未知且难以估计时,高维回归中选择性推断的挑战。
- 开发一种在模型选择后联合进行回归系数推断并估计误差方差 $σ^2$ 的方法。
- 确保在数据依赖的模型选择下,仍能提供有效的统计推断(p值、置信区间),即使 $σ^2$ 未知。
- 相较于现有方法(如Sun & Zhang, 2011 和 Reid et al., 2013)提升 $σ^2$ 估计的准确性。
- 在模型选择下的多重检验场景中,实现稳健的错误发现率(FDR)控制。
提出的方法
- 使用平方根LASSO作为模型选择程序,其调参参数 $λ$ 由于具备尺度无关特性,对噪声水平 $σ^2$ 不敏感。
- 推导平方根LASSO的Karush-Kuhn-Tucker(KKT)条件,以刻画选择事件并定义选择性推断框架。
- 应用Fithian等(2014)的选择性推断框架,构建在选定模型和符号条件下的有效p值与置信区间。
- 通过截断正态分布或t分布近似检验统计量在选择性分布下的抽样分布,方差通过 $σ_P^2(y)$ 估计。
- 利用在原假设下为辅助统计量的标准化残差向量 $U_{-E}(y)$,进行回归诊断和拟合优度检验。
- 对推导出的p值应用Benjamini-Hochberg程序,以实现多重假设检验中的FDR控制。
实验结果
研究问题
- RQ1当误差方差 $σ^2$ 未知且必须从用于模型选择的同一数据中估计时,能否可靠地进行选择性推断?
- RQ2平方根LASSO是否能够实现对系数和 $σ^2$ 的同时有效推断,且其调参与 $σ^2$ 无关?
- RQ3在高维设定下,该方法相较于现有方差估计器在准确性和稳健性方面表现如何?
- RQ4推导出的p值是否能在模型选择下的多重检验中支持有效的FDR控制?
- RQ5该方法对调参参数 $λ$ 和设计相关系数 $ρ$ 的变化有多大的鲁棒性?
主要发现
- 所提出的方法即使在 $σ^2$ 未知的情况下,也能在模型选择后生成回归系数的有效p值和置信区间。
- 平方根LASSO的调参 $λ$ 与 $σ^2$ 无关,从而实现稳定且尺度无关的模型选择。
- 模拟结果表明,该方法对 $σ^2$ 的估计精度优于现有方法,如Sun & Zhang(2011)和Reid等(2013)的方法。
- 在不同相关系数 $ρ$ 水平下,FDR控制表现稳健,所有测试的 $ρ$ 值下FDR均保持在约0.2左右。
- 相较于Barber & Candes(2016)的方法,该方法在高相关设计下统计功效高出约20%。
- 基于正态近似的置信区间覆盖概率接近名义水平(例如,95%置信区间覆盖率为94.7%),验证了该近似的合理性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。