[论文解读] Survival analysis as a classification problem
本文提出一种基于堆叠的生存分析分类框架,通过将每个未删失事件视为其风险集内的分类任务,将生存数据转化为二分类问题。该方法使多种机器学习算法(如随机森林、梯度提升和神经网络)得以应用,相较于Cox比例风险模型,在存在复杂交互作用和非线性效应的情境下,显著提升了生存曲线估计的准确性。
In this paper, we explore a method for treating survival analysis as a classification problem. The method uses a "stacking" idea that collects the features and outcomes of the survival data in a large data frame, and then treats it as a classification problem. In this framework, various statistical learning algorithms (including logistic regression, random forests, gradient boosting machines and neural networks) can be applied to estimate the parameters and make predictions. For stacking with logistic regression, we show that this approach is approximately equivalent to the Cox proportional hazards model with both theoretical analysis and simulation studies. For stacking with other machine learning algorithms, we show through simulation studies that our method can outperform Cox proportional hazards model in terms of estimated survival curves. This idea is not new, but we believe that it should be better known by statistiicians and other data scientists.
研究动机与目标
- 通过将生存问题重新表述为分类任务,弥合生存分析与机器学习之间的鸿沟。
- 开发一种基于堆叠的框架,使多样化的分类算法可用于生存数据。
- 证明使用逻辑回归的堆叠方法可近似Cox比例风险模型。
- 证明在复杂、非线性的情境下,使用先进机器学习算法的堆叠方法可提升生存曲线估计性能。
- 将该框架扩展至时变协变量,并验证其性能。
提出的方法
- 通过堆叠每个未删失事件的风险集构建大型数据框,其中每一行代表在某个事件时间点处于风险中的受试者。
- 定义一个二元响应向量,其中失败的受试者标记为1,同一风险集中其他受试者标记为0。
- 从每个风险集中所有受试者的协变量构建预测变量矩阵,并增加表示受试者特异性截距的二元列。
- 对堆叠后的数据应用分类算法(逻辑回归、随机森林、GBM、神经网络)以估计生存概率。
- 利用分类模型的预测结果估计个体生存函数。
- 通过在每个事件时间点前使用最新的协变量值,将该方法扩展至时变协变量。
实验结果
研究问题
- RQ1能否通过堆叠框架将生存分析有效重构为分类问题?
- RQ2与Cox比例风险模型相比,使用逻辑回归的堆叠方法在估计与推断方面表现如何?
- RQ3通过堆叠应用机器学习算法是否能提升生存曲线估计性能,特别是在非线性或交互作用繁重的情境下?
- RQ4与标准Cox回归相比,堆叠方法在时变协变量下的表现如何?
- RQ5不同基于堆叠的模型在Harrell的C指数和AUC指标下的预测性能如何?
主要发现
- 使用逻辑回归的堆叠方法在理论上和经验上均产生与Cox比例风险模型近似等价的估计与推断结果。
- 对于具有线性效应的模型1,使用逻辑回归的堆叠方法与Cox回归的AUC值完全相同,均为0.743。
- 对于具有非线性和交互效应的模型2,使用GBM的堆叠方法AUC达到0.781,优于Cox回归(0.727)和逻辑回归(0.727)。
- 随机森林和神经网络的表现不一:随机森林的AUC为0.686–0.691,而神经网络在模型2中的AUC较低(0.620–0.615),表明其对模型复杂度较为敏感。
- 在具有复杂效应的模拟中,使用GBM和神经网络的堆叠方法提供的生存曲线估计比Cox模型更准确,视觉对比结果清晰显示了这一点。
- 该方法扩展至时变协变量后,得到的系数和p值估计与Cox回归结果非常接近,验证了其在动态协变量设置下的稳健性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。