Skip to main content
QUICK REVIEW

[论文解读] Rank-based Lasso -- efficient methods for high-dimensional robust model selection

Wojciech Rejchel, Małgorzata Bogdan|arXiv (Cornell University)|May 14, 2019
Statistical Methods and Inference参考文献 53被引用 5
一句话总结

本文提出 RankLasso,一种计算高效的高维鲁棒模型选择方法,通过将响应值替换为其秩并应用 Lasso 回归实现。该方法引入了阈值化和自适应 RankLasso 变体,在更广泛的条件下实现模型选择一致性,包括重尾误差和非线性链接函数,模拟和真实数据实验中均优于 LADLasso。

ABSTRACT

We consider the problem of identifying significant predictors in large data bases, where the response variable depends on the linear combination of explanatory variables through an unknown link function, corrupted with the noise from the unknown distribution. We utilize the natural, robust and efficient approach, which relies on replacing values of the response variables by their ranks and then identifying significant predictors by using well known Lasso. We provide new consistency results for the proposed procedure (called ,,RankLasso") and extend the scope of its applications by proposing its thresholded and adaptive versions. Our theoretical results show that these modifications can identify the set of relevant predictors under much wider range of data generating scenarios than regular RankLasso. Theoretical results are supported by the simulation study and the real data analysis, which show that our methods can properly identify relevant predictors, even when the error terms come from the Cauchy distribution and the link function is nonlinear. They also demonstrate the superiority of the modified versions of RankLasso in the case when predictors are substantially correlated. The numerical study shows also that RankLasso performs substantially better in model selection than LADLasso, which is a well established methodology for robust model selection.

研究动机与目标

  • 解决当预测变量与响应之间的真实关系未知且可能非线性时的高维模型选择挑战。
  • 开发一种计算高效的现有鲁棒惩罚方法的替代方案,避免依赖复杂的损失函数和优化算法。
  • 在弱分布假设下确保模型选择一致性,包括重尾误差分布和未知链接函数。
  • 通过引入阈值化和自适应版本扩展 RankLasso,以改善在预测变量相关性下的有限样本性能和选择精度。
  • 在标准 Lasso 和 LADLasso 因非正态误差或模型误设而失效的情况下,证明所提方法的鲁棒性与优越性。

提出的方法

  • 将观测到的响应值 $Y_i$ 替换为其中心化秩 $R_i/n - 0.5$,以降低对异常值和未知误差分布的敏感性。
  • 将 RankLasso 估计量表述为标准 Lasso 问题,即最小化排序响应与线性预测值之间的二次损失:$\hat{\theta} = \arg\min_\theta \frac{1}{2n}\sum_{i=1}^n (R_i/n - 0.5 - \theta^T X_i)^2 + \lambda \|\theta\|_1$。
  • 通过初始估计 $\tilde{\theta}_j$ 加权 $l_1$ 惩罚项,引入自适应 RankLasso,使用 $\lambda \sum_j |\theta_j| / |\tilde{\theta}_j|$ 以提升选择一致性。
  • 提出阈值化 RankLasso,即在估计后将较小的系数设为零,以增强稀疏性与选择精度。
  • 基于 epi-收敛性和 $U$-统计量的渐近理论,推导在最小假设下的估计量的一致性与渐近正态性。
  • 利用 $\sqrt{n}(\hat{\theta} - \theta^*)$ 的收敛结果,建立改进型 RankLasso 变体的渐近正态性与模型选择一致性。

实验结果

研究问题

  • RQ1基于秩的模型选择方法是否能在真实链接函数未知且误差为重尾分布的高维设置下,一致识别出相关预测变量?
  • RQ2在预测变量相关性和非正态误差下,阈值化与自适应 RankLasso 相较于标准 RankLasso 如何提升模型选择性能?
  • RQ3RankLasso 在选择精度与计算效率方面,相较于成熟鲁棒方法如 LADLasso 的优势程度如何?
  • RQ4自适应与阈值化 RankLasso 估计量在何种条件下可实现模型选择一致性?
  • RQ5当误差分布具有无限方差(如柯西分布)时,RankLasso 是否能保持高统计功效与低假发现率?

主要发现

  • 自适应与阈值化 RankLasso 估计量在比标准 RankLasso 更广泛的条件下实现模型选择一致性($\mathbb{P}(\hat{T}^a = T) \to 1$),包括误差分布具有无限方差的情形。
  • 即使在高预测变量相关性和非正态误差下,阈值化 RankLasso 仍能以趋于 1 的概率正确识别真实模型。
  • 模拟研究显示,RankLasso 在各种场景下(包括误差服从柯西分布时)均保持高统计功效与低假发现率(FDR)。
  • 基于基因表达数据的真实数据分析表明,RankLasso 在存在异常值时比 LADLasso 更准确地识别出相关预测变量。
  • 自适应 RankLasso 估计量实现渐近正态性与一致变量选择,满足 $\sqrt{n}(\hat{\theta}^a_T - \theta^*_T) \to_d -H_1^{-1}(W_T + \bar{c})$。
  • 所提方法在计算速度与选择精度方面显著优于 LADLasso,尤其在高维、重尾误差设置下表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。