Skip to main content
QUICK REVIEW

[论文解读] An Effective Meaningful Way to Evaluate Survival Models

Shi-ang Qi, Neeraj Kumar|arXiv (Cornell University)|Jun 1, 2023
Statistical Methods and Inference被引用 4
一句话总结

本文提出 MAE-PO,一种新颖的生存模型评估指标,通过伪观测法处理右删失数据,相较于现有 MAE 变体在模型排序性能和与真实均绝对误差的接近度方面表现更优。该方法基于 Kaplan-Meier 生存概率估计伪观测值,并采用加权置信方案,其在具有多样化删失机制的半合成数据集上展现出更优的准确性。

ABSTRACT

One straightforward metric to evaluate a survival prediction model is based on the Mean Absolute Error (MAE) -- the average of the absolute difference between the time predicted by the model and the true event time, over all subjects. Unfortunately, this is challenging because, in practice, the test set includes (right) censored individuals, meaning we do not know when a censored individual actually experienced the event. In this paper, we explore various metrics to estimate MAE for survival datasets that include (many) censored individuals. Moreover, we introduce a novel and effective approach for generating realistic semi-synthetic survival datasets to facilitate the evaluation of metrics. Our findings, based on the analysis of the semi-synthetic datasets, reveal that our proposed metric (MAE using pseudo-observations) is able to rank models accurately based on their performance, and often closely matches the true MAE -- in particular, is better than several alternative methods.

研究动机与目标

  • 解决测试集中包含右删失个体时评估生存模型的挑战,此时真实事件时间未知。
  • 开发一种能考虑生存预测中删失观测值的有意义且准确的均绝对误差(MAE)度量。
  • 生成具有已知真实事件时间的逼真半合成生存数据集,以实现评估指标的无偏评估。
  • 比较多种基于 MAE 的度量,并识别出最可靠的模型排序与误差估计器。
  • 提供 MAE-PO 及相关度量的可复现代码库,以支持未来研究。

提出的方法

  • 提出 MAE-PO,一种利用伪观测值估计删失受试者对群体级 Kaplan-Meier 估计器贡献的度量。
  • 采用加权方案表示每项伪观测值的置信度,提升对删失的鲁棒性。
  • 应用伪观测值去删失技术(Andersen et al., 2003),将删失生存数据转换为可用于误差计算的可用点估计。
  • 通过模拟现实的特征分布与删失分布,生成半合成生存数据集,保留真实世界数据的结构。
  • 利用这些合成数据集中的真实事件时间计算真实 MAE,从而为评估指标提供基准。
  • 在多个数据集与删失机制下,对比六种 MAE 变体(包括 MAE-uncensored、MAE-margin、MAE-PO、IPCW-D、IPCW-T 和 MAE-Pop-PO)。

实验结果

研究问题

  • RQ1当存在删失数据时,不同 MAE 启发的度量在生存模型排序中的表现如何?
  • RQ2在存在删失观测值的情况下,哪种度量最接近真实 MAE?
  • RQ3基于伪观测值的方法(MAE-PO)是否能提供比现有替代方案更准确、更可靠的评估?
  • RQ4评估度量的性能如何随不同删失分布(如指数分布、特征无关删失、特征相关删失)而变化?
  • RQ5所提出的半合成数据集生成方法在多大程度上实现了对生存模型度量的有效且可复现的评估?

主要发现

  • 在所有数据集与删失机制下,MAE-PO 均最准确地对模型进行排序,仅在一种情况下未能正确识别出前三名模型。
  • MAE-PO 与真实 MAE 的接近度最高,在 METABRIC 和 MIMIC-A 数据集上显著优于其他方法(p < 0.05)。
  • MAE-uncensored 在高删失率下表现差,而 MAE-PO 即使在高删失场景下仍保持强劲性能。
  • MAE-margin 在某些场景下表现良好,但在 MIMIC-H 中未能识别出最佳模型,而 MAE-PO 正确识别出 GBM-C 为表现最佳模型。
  • MAE-IPCW-D 因对后期未删失受试者的敏感性,导致其与真实 MAE 接近度的方差较高,限制了其可靠性。
  • MAE-Pop-PO 在排序或误差近似方面均无优势,表现劣于 MAE-margin 和 MAE-PO。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。