Skip to main content
QUICK REVIEW

[论文解读] Scalable Sparse Cox's Regression for Large-Scale Survival Data via Broken Adaptive Ridge

Eric S. Kawaguchi, Marc A. Suchard|arXiv (Cornell University)|Dec 2, 2017
Statistical Methods and Inference参考文献 61被引用 7
一句话总结

该论文提出CoxBAR,一种用于大规模生存数据的可扩展稀疏Cox回归方法,通过迭代重加权岭回归近似$L_0$-惩罚回归。该方法实现了选择一致性、Oracle性质以及计算效率——通过利用高效的$L_2$优化,避免了昂贵的调参选择,相较于竞争对手实现了高达5倍的加速。

ABSTRACT

This paper develops a new scalable sparse Cox regression tool for sparse high-dimensional massive sample size (sHDMSS) survival data. The method is a local $L_0$-penalized Cox regression via repeatedly performing reweighted $L_2$-penalized Cox regression. We show that the resulting estimator enjoys the best of $L_0$- and $L_2$-penalized Cox regressions while overcoming their limitations. Specifically, the estimator is selection consistent, oracle for parameter estimation, and possesses a grouping property for highly correlated covariates. Simulation results suggest that when the sample size is large, the proposed method with pre-specified tuning parameters has a comparable or better performance than some popular penalized regression methods. More importantly, because the method naturally enables adaptation of efficient algorithms for massive $L_2$-penalized optimization and does not require costly data driven tuning parameter selection, it has a significant computational advantage for sHDMSS data, offering an average of 5-fold speedup over its closest competitor in empirical studies.

研究动机与目标

  • 解决现有惩罚Cox回归方法在稀疏高维大规模样本量(sHDMSS)生存数据上的计算不可行性。
  • 通过近似$L_0$-惩罚回归,克服$L_1$(LASSO)和$L_2$(岭回归)惩罚的局限性——即估计偏差和缺乏稀疏性,分别。
  • 开发一种在sHDMSS设置下具备选择一致性、Oracle效率,并对相关协变量具有组稀疏性的方法。
  • 使稀疏生存建模在真实世界数据集(如国家创伤数据库和药物安全数据库)中的实际应用成为可能,这些数据集包含数亿条记录。

提出的方法

  • CoxBAR使用迭代重加权$L_2$-惩罚Cox回归来近似$L_0$-惩罚回归,从初始的Cox岭估计器开始。
  • 在每次迭代中,根据当前岭估计量的大小更新权重,将小系数收缩至零,同时保留大系数。
  • 该方法利用高效的$L_2$-惩罚优化算法,实现了对$n$达数亿、$p_n$达数万的可扩展性。
  • 通过使用预设的调参,避免了昂贵的数据驱动调参选择,显著降低了计算开销。
  • 最终估计器具有选择一致性,并对非零系数表现出类似Oracle岭估计器的行为,同时对高度相关的协变量具有分组特性。
  • 该方法自然继承了岭回归的稳定性,同时实现了类似$L_0$-惩罚的稀疏性。

实验结果

研究问题

  • RQ1能否开发一种可扩展方法,将$L_0$-惩罚的稀疏性与$L_2$-惩罚的稳定性和效率相结合,用于高维生存分析?
  • RQ2迭代重加权$L_2$回归在变量选择和估计精度方面,能否有效近似$L_0$-惩罚Cox回归?
  • RQ3所提出的方法能否在不牺牲统计性能的前提下,实现相对于现有惩罚回归方法在sHDMSS数据上的显著计算加速?
  • RQ4该方法在大规模生存数据集上的选择一致性、假阳性/假阴性控制以及模型选择准确性方面表现如何?

主要发现

  • CoxBAR实现了非零系数的选择一致性和渐近正态性,对高度相关的协变量具有分组特性。
  • 在$n=300$,$p_n=2500$和$p_n=5000$的模拟中,SJS-$L_0$-CoxBAR的BIC得分最低(1227.182),在BLCA数据集中仅选中20个基因,优于LASSO和SCAD。
  • 在实证研究中,该方法平均比其最接近的竞争对手快5倍,原因是避免了昂贵的调参优化。
  • SJS-BIC-CoxBAR和SJS-cBIC-CoxBAR选择的变量更少(分别为5个和7个),而数据驱动方法选择的变量为20–36个,同时保持了具有竞争力的BIC得分。
  • 对于$n=300$,$p_n=2500$,SJS-BIC-CoxBAR实现了100%的真实模型概率(TM)和92%的首次真实协变量正确识别概率($P_1$),假阳性率(0.81)和假阴性率(0.12)均较低。
  • 在多个模拟设置下,该方法在AIC和BIC得分上均优于LASSO、SCAD和ALASSO,其中SJS-$L_0$-CoxBAR在$n=300$,$p_n=2500$情况下取得了最佳AIC(1906.83)和BIC(2017.24)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。