Skip to main content
QUICK REVIEW

[论文解读] Stepwise Choice of Covariates in High Dimensional Regression

Laurie Davies|arXiv (Cornell University)|Oct 17, 2016
Statistical Methods and Inference参考文献 11被引用 3
一句话总结

该论文提出了一种针对高维线性模型的无模型逐步回归方法,通过将实际协变量的残差平方和减少量与独立高斯噪声的减少量进行比较来选择协变量。该方法利用贝塔分布推导出精确的p值,以评估显著性,无需正则化、交叉验证或误差方差估计,实现了模型一致性,并在模拟中表现优于Lasso方法。

ABSTRACT

Given data y(n) and p(n)covariates x(n) one problem in linear regression is to decide which if any of the covariates to include. There are many articles on this problem but all are based on a stochastic model for the data. This paper gives what seems to be a new approach which does not require any form of model. It is conceptually and algorithmically simple and consistency results can be proved under appropriate assumptions.

研究动机与目标

  • 开发一种在高维线性回归中进行协变量选择的方法,该方法不依赖于随机模型或误差方差估计。
  • 提供一种计算简单且对协变量仿射变换和排列保持不变的替代方法,以替代Lasso等需要正则化或交叉验证的现有方法。
  • 基于实际协变量与i.i.d.高斯噪声在残差减少方面的比较,建立显著性检验框架。
  • 将该方法扩展至稳健回归和非线性回归,并使用近似p值。
  • 在高维设置下证明方法的一致性并实现更优的错误发现率控制。

提出的方法

  • 该方法计算一个随机高斯协变量在残差平方和减少量上超过实际协变量的概率,利用噪声下残差减少量的精确分布。
  • 使用精确分布 $ SS_{\nu} \stackrel{D}{=} ss_0(1 - B_{1/2, (n - \nu_0 - 1)/2}) $ 计算p值,其中 $ B_{a,b} $ 为贝塔分布随机变量。
  • 引入新协变量的p值由下式给出:$ \mathbf{P}(SS_{01} \leq ss_{01}) = 1 - \text{pbeta}(1 - ss_{01}/ss_0, 1/2, (n - \nu_0 - 1)/2)^{q(n) - \nu_0} $。
  • 停止规则通过该p值的逆推导得出:$ ss_{01} > ss_0 \left(1 - \text{qbeta}((1 - \alpha)^{1/(q(n) - \nu_0)}, 1/2, (n - \nu_0 - 1)/2) \right) $。
  • 该方法在协变量的仿射变换和排列下保持不变,并通过联合概率 $ \prod_{j=1}^{\nu} (1 - p_j) $ 避免了多重检验问题。
  • 对于非线性和稳健回归,当精确p值不可用时,采用基于卡方分布的近似方法。

实验结果

研究问题

  • RQ1在高维回归中,协变量选择能否在不假设线性模型或估计误差方差的情况下完成?
  • RQ2一个随机高斯协变量在减少残差平方和方面优于实际协变量的概率是多少?
  • RQ3如何构建一种一致且无需正则化或交叉验证的逐步选择程序?
  • RQ4在高维设置下,该方法是否比Lasso更好地控制错误发现率?
  • RQ5该方法能否在最小假设下扩展至稳健和非线性回归?

主要发现

  • 在适当的正则性条件下,该方法在高维线性回归中实现了模型一致性,且无需误差方差估计。
  • 利用贝塔分布推导出协变量包含的精确p值,替代了早期的卡方近似方法。
  • 在n=72、q(n)=3571的白血病数据集中,该方法比Lasso更少产生假阳性,正确识别出相关基因。
  • 在图模型重构中,1747个真实边中有1109个被成功恢复,仅产生两个假阳性,优于基于Lasso的方法。
  • 模拟结果表明,该方法在高维设置下保持了较低的错误发现率,并在边恢复方面优于Lasso。
  • 渐近停止规则为 $ ss_{01} > ss_0 \left(1 - \frac{2\log q(n) - \log\log q(n) - 2\log(-\log(1 - \alpha))}{n} \right) $,提供了一种无模型的阈值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。