[论文解读] Confidence intervals for high-dimensional Cox models
本文提出了一种针对高维Cox模型(p ≫ n)的去偏方法,通过使用修正的CLIME估计器来估计稀疏精度矩阵,并结合一步去偏估计器,构建回归系数的渐近有效置信区间。关键贡献是在温和正则性条件下,即使在无限时间支持和非恒定风险集的情况下,也对去偏估计器的线性泛函实现了渐近正态性的理论保证。
The purpose of this paper is to construct confidence intervals for the regression coefficients in high-dimensional Cox proportional hazards regression models where the number of covariates may be larger than the sample size. Our debiased estimator construction is similar to those in Zhang and Zhang (2014) and van de Geer et al. (2014), but the time-dependent covariates and censored risk sets introduce considerable additional challenges. Our theoretical results, which provide conditions under which our confidence intervals are asymptotically valid, are supported by extensive numerical experiments.
研究动机与目标
- 为高维Cox比例风险模型中协变量数p超过样本量n的回归系数构建有效的置信区间。
- 解决高维生存分析中时间依赖协变量和右删失风险集带来的标准推断挑战。
- 开发一种去偏估计器,使其在超高维设置(p = o(exp(n^a)),对所有a > 0)下,对线性泛函c⊤β实现渐近正态性,从而支持有效推断。
- 通过新颖的截断论证和修正精度矩阵估计,克服弱收敛假设和无限时间支持等理论障碍。
- 为高维生存数据提供一种实用且理论基础坚实的推断方法,尤其适用于生物医学和基因组学领域。
提出的方法
- 使用Lasso惩罚的偏似然估计器作为初始稀疏估计器β̂,以估计高维回归系数。
- 通过修正的CLIME方法构建稀疏精度矩阵估计器bΘ,以近似对数偏似然的负Hessian矩阵的逆。
- 应用一步去偏校正:β̃ = β̂ + bΘ × ˙ℓ(β̂),其中˙ℓ(β̂)为在β̂处的得分函数,以减少初始估计器的偏差。
- 采用新颖的截断论证处理无限时间支持和非恒定风险集,避免对协方差过程弱收敛性的强假设。
- 使用修正的CLIME估计器,考虑Cox模型中倾斜权重引起的均值漂移设计矩阵,保持必要的独立性结构。
- 通过浓度不等式和局部鞅论证,建立c⊤β̃的渐近正态性,控制经验过程与其均值的偏离。
实验结果
研究问题
- RQ1能否为高维Cox模型(p ≫ n)中的回归系数构建有效的置信区间?
- RQ2去偏方法如何适应生存数据的时间依赖性和删失特性,特别是非恒定风险集的情况?
- RQ3在存在无限时间支持和均值漂移协变量的情况下,什么条件能确保去偏估计器的渐近正态性?
- RQ4该理论框架能否避免经典局部鞅中心极限定理中固有的强弱收敛假设?
- RQ5该方法的性能如何依赖于样本大小和稀疏性,特别是对信号变量与噪声变量的影响?
主要发现
- 所提出的去偏估计器β̃对任意固定的线性泛函c⊤β均为渐近正态分布,其方差-协方差结构可通过修正CLIME精度矩阵进行估计。
- 在温和条件下,该方法实现了置信区间的渐近有效性,包括p = o(exp(n^a))(对所有a > 0),覆盖了超高维情形。
- 数值实验表明,即使样本量相对较小,也能为噪声变量获得有效的p值和置信区间,而信号变量则需要更大的样本量才能实现良好覆盖。
- 理论分析表明,在适当的稀疏性和特征值条件下,去偏估计器的估计误差为Op(√(log(np)/n))。
- 截断论证成功处理了无限时间支持和非恒定风险集,使理论可推广至有界时间区间之外的设定。
- 修正的CLIME估计器即使在设计矩阵存在均值漂移时,也能实现精度矩阵的一致估计,克服了Cox模型中的一个关键挑战。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。