[论文解读] Spearman Rank Correlation Screening for Ultrahigh-dimensional Censored Data
本文提出了一种无模型、鲁棒的筛选方法——右删失数据的斯皮尔曼等级相关筛选(SRCS_cen)——该方法利用基于秩次的依赖性度量,在超高维右删失生存数据中识别重要预测变量。该方法在高删失率、重尾分布、异常值以及预测变量之间存在相关性的情况下仍保持高性能,其在模拟实验和真实数据分析中均优于现有的非参数筛选方法。
Herein, we propose a Spearman rank correlation based screening procedure for ultrahigh-dimensional data with censored response case. The proposed method is model-free without specifying any regression forms of predictors or response variable and is robust under the unknown monotone transformations of these response variable and predictors. The sure-screening and rank-consistency properties are established under some mild regularity conditions. Simulation studies demonstrate that the new screening method performs well in the presence of a heavy-tailed distribution, strongly dependent predictors or outliers and that offers superior performance over the existing nonparametric screening procedures. In particular, the new screening method still works well when a response variable is observed under a high censoring rate. An illustrative example is provided.
研究动机与目标
- 解决现有筛选方法在超高维右删失数据中,尤其是在高删失率和模型误设情况下的局限性。
- 开发一种对预测变量和响应变量的单调变换不变的无模型筛选程序。
- 确保对重尾分布、异常值以及预测变量间强相关性的鲁棒性。
- 在较弱的正则性条件下,建立理论保证——确保筛选与秩次一致性。
- 在模拟实验和真实世界生存数据分析中,证明其在性能上优于现有的非参数和基于模型的筛选方法。
提出的方法
- 基于边际累积分布函数乘积的期望提出总体筛选指数:$\omega_k = \mathbb{E}[F_k(X_k)F(Y)] - \mathbb{E}[F_k(X_k)]\mathbb{E}[F(Y)]$,用于度量预测变量$X_k$与响应变量$Y$之间的依赖性。
- 通过逆概率加权法对删失响应进行插补,以在删失数据中实现基于秩次的相关性估计。
- 以斯皮尔曼等级相关为边际筛选的基础,确保$X_k$和$Y$的单调变换不变性。
- 采用两步程序:(1) 根据估计的$\omega_k$值对预测变量进行排序,以选择前导特征;(2) 将其与惩罚回归方法(SCAD、MCP、Lasso)结合,用于最终模型拟合。
- 利用经验似然和经验分布函数,从观测数据中估计总体指数$\omega_k$。
- 通过弱正则性条件建立理论性质,证明所提方法具有确保筛选与秩次一致性。
实验结果
研究问题
- RQ1在高删失率条件下,无模型筛选方法是否仍能在超高维右删失数据中保持高选择准确性?
- RQ2在存在异常值、重尾分布和预测变量相关性的情况下,所提出的SRCS_cen方法相较于现有非参数筛选程序表现如何?
- RQ3筛选性能在多大程度上对响应变量和预测变量的单调变换保持鲁棒?
- RQ4针对删失数据的插补方法是否能保持筛选指数的秩次一致性和确保筛选性质?
- RQ5SRCS_cen与惩罚回归结合后,是否能提升高维协变量生存分析中的预测准确性?
主要发现
- 在真实数据分析中,所提出的SRCS_cen方法在所有右删失筛选方法中,500次重复的平均预测误差平方的中位数最小,表明其具有更优的预测性能。
- 在套细胞淋巴瘤数据集中,SRCS_cen选出的前20名预测变量中有30个与其它方法(CQScen(0.5)和RCS_cen)的共同结果一致,显示出与现有方法最高的吻合度。
- 基因28990(细胞周期蛋白依赖性激酶2)被SRCS_cen排在首位,且此前已被Huang和Ma(2010)以及Wu和Yin(2015)证实与生存风险显著相关,证实了其生物学相关性。
- 该方法在高删失率条件下仍保持强劲性能,而传统针对完整响应的筛选方法则失效或性能显著下降。
- 模拟研究证实,SRCS_cen在选择准确性方面优于现有非参数筛选程序,尤其在重尾分布和异常值存在时表现更优。
- 理论分析在较弱正则性条件下建立了SRCS_cen的确保筛选与秩次一致性,验证了其统计可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。