Skip to main content
QUICK REVIEW

[论文解读] A note relating ridge regression and OLS p-values to preconditioned sparse penalized regression

Karl Rohe|arXiv (Cornell University)|Nov 26, 2014
Sparse and Compressive Sensing Techniques参考文献 16被引用 3
一句话总结

本文建立了预处理稀疏惩罚回归与经典线性回归估计量之间的理论联系。结果表明,当设计矩阵满秩时,Puffer 预处理的 Lasso 等价于对 OLS 估计量进行软阈值处理;在高维设置下,广义 Puffer 预处理器将岭回归与 Lasso 联系起来,使 Lasso 行为类似于后向消除法,而非前向选择法。

ABSTRACT

When the design matrix has orthonormal columns, "soft thresholding" the ordinary least squares (OLS) solution produces the Lasso solution [Tibshirani, 1996]. If one uses the Puffer preconditioned Lasso [Jia and Rohe, 2012], then this result generalizes from orthonormal designs to full rank designs (Theorem 1). Theorem 2 refines the Puffer preconditioner to make the Lasso select the same model as removing the elements of the OLS solution with the largest p-values. Using a generalized Puffer preconditioner, Theorem 3 relates ridge regression to the preconditioned Lasso; this result is for the high dimensional setting, p > n. Where the standard Lasso is akin to forward selection [Efron et al., 2004], Theorems 1, 2, and 3 suggest that the preconditioned Lasso is more akin to backward elimination. These results hold for sparse penalties beyond l1; for a broad class of sparse and non-convex techniques (e.g. SCAD and MC+), the results hold for all local minima.

研究动机与目标

  • 建立预处理 Lasso 与经典 OLS 和岭回归估计量之间的理论等价性。
  • 证明 Puffer 预处理器可将软阈值关系从正交设计推广至满秩设计矩阵。
  • 优化预处理器,使 Lasso 的变量选择与剔除 OLS p 值最大的变量完全一致。
  • 在高维设置($p > n$)下,通过广义 Puffer 预处理器将岭回归与 Lasso 联系起来。
  • 表明预处理 Lasso 的行为类似于后向消除法,而标准 Lasso 则类似于前向选择法。

提出的方法

  • 对设计矩阵 $\mathbf{X}$ 应用 Puffer 预处理器 $F = U D^{-1} U'$,将其变换为正交矩阵 $F\mathbf{X}$。
  • 以软阈值处理 $t_\lambda(\hat{\beta}^{\text{ols}})$ 为核心操作,建立预处理 Lasso 与 OLS 估计量之间的联系。
  • 提出一种改进的 Puffer 预处理器 $\text{Puffer}_N$,通过标准误校正考虑 $\hat{\beta}^{\text{ols}}$ 中的异方差性。
  • 提出一种广义 Puffer 预处理器 $\text{Puffer}_\tau$,用于在高维设置下将岭回归与 Lasso 联系起来。
  • 分析在预处理下不同稀疏惩罚(如 SCAD、MC+)的局部极小值,表明其在 $\mathbf{X}$ 的行空间中彼此接近。
  • 证明当 $\lambda \to 0$ 时,预处理 Lasso 路径收敛于岭回归解,暗示其具有后向消除行为特征。

实验结果

研究问题

  • RQ1软阈值与 Lasso 之间的关系能否从正交设计推广至一般满秩设计矩阵?
  • RQ2能否构造一种预处理器,使得 Lasso 的变量选择与剔除 OLS p 值最大的变量完全一致?
  • RQ3在高维设置($p > n$)下,如何通过预处理将岭回归与 Lasso 联系起来?
  • RQ4预处理是否能将 Lasso 从类似前向选择的过程转变为类似后向消除的过程?
  • RQ5在相同预处理 Lasso 框架下,不同稀疏惩罚的局部极小值行为如何?

主要发现

  • 定理 1 表明,当 $\mathbf{X}$ 满秩时,$Lasso_\lambda(\text{Puffer}(\mathbf{X}, Y)) = t_\lambda(\hat{\beta}^{\text{ols}})$,将 Tibshirani 的结果从正交设计推广至一般满秩设计。
  • 定理 2 提出一种校正后的预处理器 $\text{Puffer}_N$,使得 Lasso 解与基于剔除 OLS p 值最大变量的变量选择完全一致。
  • 定理 3 表明,在高维设置($p > n$)下,$\mathscr{P}_\tau(Lasso_\lambda(\text{Puffer}_\tau(\mathbf{X}, Y))) \to \hat{\beta}_{\text{ridge}}(\tau)$ 当 $\lambda \to 0$,建立了预处理 Lasso 与岭回归之间的联系。
  • 由于设计矩阵经过正交化处理,预处理 Lasso 的行为类似于后向消除法,而标准 Lasso 则类似于前向选择法。
  • 在相同预处理下,不同稀疏惩罚(如 SCAD、MC+)的局部极小值在 $\mathbf{X}$ 的行空间中彼此相差不超过 $2\lambda$,表明其具有高度稳定性。
  • 由于 Puffer 变换引入的正交化,预处理 Lasso 实现了符号一致性,且无需满足不可表示性条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。