Skip to main content
QUICK REVIEW

[论文解读] Logistic Regression with Missing Covariates -- Parameter Estimation, Model Selection and Prediction within a Joint-Modeling Framework

Wei Jiang, Julie Josse|arXiv (Cornell University)|May 11, 2018
Statistical Methods and Bayesian Inference参考文献 31被引用 5
一句话总结

本文提出了一种计算高效的随机近似期望最大化(SAEM)算法,用于在缺失 at at random(MAR)机制下进行缺失协变量的逻辑回归。该方法支持参数估计、方差推断、置信区间构建、基于BIC的模型选择以及对具有缺失数据的新观测值的预测——在偏差和覆盖区间方面优于多重插补方法,该结论通过模拟实验和创伤患者数据集得到验证,相关方法已集成于R包 misaem 中。

ABSTRACT

Logistic regression is a common classification method in supervised learning. Surprisingly, there are very few solutions for performing logistic regression with missing values in the covariates. We suggest a complete approach based on a stochastic approximation version of the EM algorithm to do statistical inference with missing values including the estimation of the parameters and their variance, derivation of confidence intervals and a model selection procedure. We also tackle the problem of prediction for new observations (on a test set) with missing covariate data. The methodology is computationally efficient, and its good coverage and variable selection properties are demonstrated in a simulation study where we contrast its performances to other methods. For instance, the popular approach of multiple imputation by chained equations can lead to estimates that exhibit meaningfully greater biases than the proposed approach. We then illustrate the method on a dataset of severely traumatized patients from Paris hospitals to predict the occurrence of hemorrhagic shock, a leading cause of early preventable death in severe trauma cases. The aim is to consolidate the current red flag procedure, a binary alert identifying patients with a high risk of severe hemorrhage. The methodology is implemented in the R package misaem.

研究动机与目标

  • 为现实世界数据中缺失协变量的逻辑回归缺乏稳健且计算高效的处理方法提供解决方案。
  • 开发一种联合建模框架,支持在MAR缺失机制下进行完整的统计推断,包括参数估计、方差估计和置信区间构建。
  • 在数据不完整的情况下,利用惩罚似然准则(BIC)实现模型选择。
  • 为具有缺失协变量值的新观测值提供预测框架。
  • 通过减少有限样本中的偏差并改善覆盖区间,改进现有方法(如多重插补)的表现。

提出的方法

  • 本文采用随机近似期望最大化(SAEM)算法,用马尔可夫链蒙特卡洛(MCMC)方法中的Metropolis-Hastings抽样替代传统EM算法中难以计算的期望步骤。
  • SAEM通过递归随机近似方法估计完整数据对数似然的条件期望,避免了对大规模MCMC样本的需求,从而降低了计算成本。
  • 方差估计采用Louis公式的一种蒙特卡洛版本,支持标准误和置信区间的计算。
  • 模型选择基于针对不完整数据调整的惩罚观测似然准则(BIC),支持在存在缺失值时的变量选择。
  • 对具有缺失协变量值的新观测值的预测,通过在估计模型下对缺失值的后验分布进行积分实现。
  • 该方法已实现于R包 misaem 中,可在CRAN上获取,且可通过GitHub实现完全可复现性。

实验结果

研究问题

  • RQ1在MAR缺失机制下,所提出的基于SAEM的逻辑回归方法与多重插补相比,在参数估计的偏差和覆盖区间方面表现如何?
  • RQ2当协变量缺失时,SAEM框架是否能够支持基于BIC的可靠模型选择?
  • RQ3该方法在预测具有缺失协变量值的新观测值结果方面效果如何?
  • RQ4在具有高缺失率的真实世界医学数据中,该方法是否在统计效率和准确性方面优于现有方法?
  • RQ5数据分布形状(如偏度)对方法性能有何影响?是否通过如对数变换等预处理能改善结果?

主要发现

  • 在模拟实验中,SAEM方法在95%置信区间的覆盖率达到93.8%–95.5%,优于多重插补方法(例如在t分布下β₃的覆盖率为81.5%),且偏差更低。
  • SAEM方法在所有参数和误差分布(t分布、正态混合分布)下均保持良好的覆盖区间(94%–95%),而多重插补(mice)则表现出覆盖不足(如β₃的覆盖率为81.5%)且偏差更高。
  • 在TraumaBase数据集中,SAEM方法AUC达到88.5%,准确率为86.9%,敏感性为74.6%,特异性为88.2%——在预测性能上优于大多数对比方法。
  • 与missForest、impMean、impPCA和mice相比,该方法在AUC和特异性方面表现更优,且在所有方法中除predSVM外,精确度最高(41.1%)。
  • 研究发现,在分析前对协变量进行对数变换并无益处,因为此类变换仅作用于可观测数据,可能在MAR机制下扭曲变量间关系。
  • R包 misaem 成功实现了SAEM算法,使得缺失协变量的逻辑回归分析具备可复现性和高效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。