Skip to main content
QUICK REVIEW

[论文解读] SurvSHAP(t): Time-dependent explanations of machine learning survival models

Mateusz Krzyziński, Mikołaj Spytek|arXiv (Cornell University)|Aug 23, 2022
Explainable Artificial Intelligence (XAI)被引用 8
一句话总结

本文提出 SurvSHAP(t),这是首个基于 Shapley 值的、与模型无关的、时间依赖的机器学习生存模型解释方法。它提供对生存函数预测的局部、时变特征归因,相较于 SurvLIME 在检测时变效应方面表现更优,并提供更准确的局部特征重要性排序。

ABSTRACT

Machine and deep learning survival models demonstrate similar or even improved time-to-event prediction capabilities compared to classical statistical learning methods yet are too complex to be interpreted by humans. Several model-agnostic explanations are available to overcome this issue; however, none directly explain the survival function prediction. In this paper, we introduce SurvSHAP(t), the first time-dependent explanation that allows for interpreting survival black-box models. It is based on SHapley Additive exPlanations with solid theoretical foundations and a broad adoption among machine learning practitioners. The proposed methods aim to enhance precision diagnostics and support domain experts in making decisions. Experiments on synthetic and medical data confirm that SurvSHAP(t) can detect variables with a time-dependent effect, and its aggregation is a better determinant of the importance of variables for a prediction than SurvLIME. SurvSHAP(t) is model-agnostic and can be applied to all models with functional output. We provide an accessible implementation of time-dependent explanations in Python at http://github.com/MI2DataLab/survshap.

研究动机与目标

  • 解决复杂生存模型缺乏时间依赖性解释方法的问题,特别是那些默认不可解释的黑箱模型。
  • 克服现有方法(如 SurvLIME)的局限性,后者假设特征效应随时间不变,无法捕捉随时间动态变化的变量影响。
  • 为具有函数型输出的生存模型提供理论基础坚实、与模型无关的解释框架,确保在解释生存函数预测时具备局部准确性。
  • 使领域专家(尤其是医疗领域)能够解释和验证随机生存森林与深度学习生存模型等先进模型的预测结果。
  • 通过提供直观、时间分辨的特征贡献可视化,促进机器学习在生存分析中的信任与应用。

提出的方法

  • 通过将 Shapley 值适配于解释函数型输出(特别是随时间变化的生存函数),将 SHapley Additive exPlanations (SHAP) 扩展至生存模型。
  • 为每个特征计算时间依赖的 Shapley 值,使得在每个时间点,其总和等于模型预测的生存函数值。
  • 采用蒙特卡洛近似方法高效估算 Shapley 值,同时考虑所有可能的特征联盟,且保持局部准确性。
  • 可应用于任何具有函数型输出的生存模型,包括随机生存森林和深度学习模型,无需进行模型特定的修改。
  • 通过在时间范围内积分,将时间依赖的归因聚合为全局重要性评分,从而实现对整个生存曲线上特征影响的比较。
  • 以 scikit-survival Python 包作为实现基础,确保与现有生存建模工作流程的兼容性。

实验结果

研究问题

  • RQ1一种与模型无关的解释方法能否为生存模型预测提供时间依赖的归因,以捕捉特征效应随时间演变的过程?
  • RQ2SurvSHAP(t) 在检测对生存结果具有时变效应的特征方面是否优于 SurvLIME?
  • RQ3SurvSHAP(t) 是否能通过在每个时间点对特征贡献求和,准确重现生存函数预测?
  • RQ4与 SurvLIME 基于系数的重要性度量相比,时间依赖的 Shapley 值聚合方法在识别关键预测因子方面表现如何?
  • RQ5SurvSHAP(t) 在无需架构修改的情况下,能否广泛应用于复杂模型(如随机生存森林和深度学习生存模型)?

主要发现

  • SurvSHAP(t) 有效捕捉了特征对生存预测的时间依赖效应,而 SurvLIME 因假设效应随时间不变而无法检测此类效应。
  • 对 SurvSHAP(t) 值在时间上的聚合提供了比 SurvLIME 基于系数的方法更准确、更可靠的局部特征重要性度量。
  • SurvSHAP(t) 满足局部准确性属性,确保在每个时间点,特征归因的总和精确等于模型的生存函数预测值。
  • 在合成数据和真实医疗数据上的实验表明,SurvSHAP(t) 能够正确识别出其对生存影响随时间变化的特征。
  • 该方法可应用于任何具有函数型输出的生存模型,包括随机生存森林和深度学习模型,展现出广泛的与模型无关的实用性。
  • 提供了开源的 Python 实现,可立即集成至使用 scikit-survival 库的现有生存建模工作流中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。