[论文解读] Inference for the Case Probability in High-dimensional Logistic Regression
本文提出了一种在高维逻辑回归中使用线性化和方差增强技术来校正偏差的病例概率估计量。该估计量具有渐近正态性,即使在预测变量数量超过样本量时,也能通过置信区间和假设检验实现有效的统计推断。
Labeling patients in electronic health records with respect to their statuses of having a disease or condition, i.e. case or control statuses, has increasingly relied on prediction models using high-dimensional variables derived from structured and unstructured electronic health record data. A major hurdle currently is a lack of valid statistical inference methods for the case probability. In this paper, considering high-dimensional sparse logistic regression models for prediction, we propose a novel bias-corrected estimator for the case probability through the development of linearization and variance enhancement techniques. We establish asymptotic normality of the proposed estimator for any loading vector in high dimensions. We construct a confidence interval for the case probability and propose a hypothesis testing procedure for patient case-control labelling. We demonstrate the proposed method via extensive simulation studies and application to real-world electronic health record data.
研究动机与目标
- 为高维电子健康记录(EHR)预测模型中病例概率的统计推断方法缺失问题提供解决方案。
- 在 p ≫ n 的情况下,为疾病状态的条件概率(即病例概率)开发一个可靠的估计量。
- 为电子健康记录中患者的病例对照标签实现假设检验和置信区间构建。
- 通过引入对感兴趣函数 h(x*ᵀβ) 的有效推断,扩展现有的惩罚估计方法。
- 支持临床表型分析任务,例如利用EHR数据识别适合原发性醛固酮增多症筛查的患者。
提出的方法
- 通过估计方程的线性化,提出一种对病例概率 h(x*ᵀβ) 进行偏差校正的估计量。
- 在高维设置下,应用方差增强技术以稳定估计量的方差。
- 使用收缩原理和对称化方法,控制随机索引集上经验过程的上确界。
- 采用类似于Rademacher复杂度的论证方法,并结合次高斯浓度不等式,对经验过程项进行有界。
- 在设计矩阵满足稀疏性和矩条件的假设下,推导出估计量的渐近正态性。
- 基于估计量的渐近分布,构建置信区间和假设检验。
实验结果
研究问题
- RQ1当 p ≫ n 时,能否对高维逻辑回归中的病例概率 h(x*ᵀβ) 进行有效的统计推断?
- RQ2在稀疏高维模型中,如何校正估计病例概率的偏差,以实现可靠的推断?
- RQ3在高维渐近条件下,病例概率估计量的渐近分布是什么?
- RQ4能否基于EHR数据为患者的病例对照标签构建置信区间和假设检验?
- RQ5与标准的惩罚估计方法相比,所提出的方法在有限样本下的表现如何?
主要发现
- 所提出的病例概率偏差校正估计量在高维渐近条件下具有渐近正态性。
- 该估计量在高维情况下对任意固定的载荷向量 x* 均能实现有效推断。
- 在渐近正态性假设下,病例概率的置信区间具有正确的覆盖概率。
- 对 H₀: h(x*ᵀβ) < 1/2 的假设检验是有效的,且保持了正确的第一类错误率。
- 通过大量模拟实验和在宾夕法尼亚大学医学中心EHR数据上的真实世界应用,证明了该方法的稳健性。
- 在设计矩阵满足稀疏性、次高斯设计以及对设计矩阵和参数向量的正则性条件下,理论保证成立。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。