[论文解读] Survival Regression with Proper Scoring Rules and Monotonic Neural Networks
该论文提出 SuMo-net,一种新型生存回归模型,通过在时变神经网络权重中强制单调性,直接优化右删失对数似然——一种合适的评分规则。该方法在推理速度上比现有神经生存模型快 20–100 倍,同时实现最先进水平的对数似然性能,使大规模数据集上的可扩展且校准良好的生存建模成为可能。
We consider frequently used scoring rules for right-censored survival regression models such as time-dependent concordance, survival-CRPS, integrated Brier score and integrated binomial log-likelihood, and prove that neither of them is a proper scoring rule. This means that the true survival distribution may be scored worse than incorrect distributions, leading to inaccurate estimation. We prove that, in contrast to these scores, the right-censored log-likelihood is a proper scoring rule, i.e., the highest expected score is achieved by the true distribution. Despite this, modern feed-forward neural-network-based survival regression models are unable to train and validate directly on the right-censored log-likelihood, due to its intractability, and resort to the aforementioned alternatives, i.e., non-proper scoring rules. We therefore propose a simple novel survival regression method capable of directly optimizing log-likelihood using a monotonic restriction on the time-dependent weights, coined SurvivalMonotonic-net (SuMo-net). SuMo-net achieves state-of-the-art log-likelihood scores across several datasets with 20--100$ imes$ computational speedup on inference over existing state-of-the-art neural methods, and is readily applicable to datasets with several million observations.
研究动机与目标
- 识别并修正常用于右删失生存回归的评分规则中的缺陷,这些规则并非合适评分规则,可能更偏好错误分布而非真实分布。
- 从理论上证明右删失对数似然是一个合适评分规则,确保真实分布能获得最高期望得分。
- 开发一种可扩展、灵活且高效的神经网络模型,实现对右删失对数似然的直接优化,克服现有方法中的不可计算性问题。
- 证明基于合适评分规则训练的模型能产生更优校准的生存预测,尤其在医疗和金融等安全关键应用中至关重要。
- 提供一种可推广的框架,用于在可计算似然基础上训练生存模型,促进跨领域的模型比较与评估。
提出的方法
- 提出一种单调神经网络架构,其中时变权重被约束为单调非递减,确保累积分布函数有效且似然可计算。
- 构建生存模型,使得预测的生存函数源自网络输出的单调变换,保留似然评估所需的数学性质。
- 直接在右删失对数似然上进行训练,该似然已被证明是合适评分规则,避免使用一致性或 Brier 评分等代理目标。
- 在测试时仅通过一次前向传播即可计算生存概率,相比需要对风险函数进行数值积分的模型,实现数量级的推理速度提升。
- 使用基于 ReLU 的单调层实现对生存函数的可微分近似,支持使用标准反向传播进行端到端训练。
- 将模型与标准深度学习框架集成,以支持未来扩展至表格数据、基因组数据或图像数据等高维输入。
实验结果
研究问题
- RQ1时间依赖性一致性、综合 Brier 评分和生存 CRPS 是否为右删失生存回归的合适评分规则?
- RQ2右删失对数似然是否构成合适评分规则,确保真实生存分布获得最高期望得分?
- RQ3能否设计一种神经网络架构,使右删失对数似然可直接优化,同时保持模型灵活性?
- RQ4此类模型是否能在对数似然性能上达到最先进水平,同时在推理速度上显著优于现有方法?
- RQ5在合适评分规则上直接优化是否能产生比基于非合适代理评分训练的模型更优校准的生存预测?
主要发现
- 时间依赖性一致性、综合 Brier 评分、伯努利对数似然和生存 CRPS 均非合适评分规则,因为它们可能为错误分布分配高于真实分布的得分。
- 右删失对数似然被证明是合适评分规则,即真实生存分布能最大化期望得分。
- SuMo-net 在多个基准数据集(包括 FLCHAIN、GBSG、KKBOX、METABRIC 和 SUPPORT)上均实现了最先进水平的对数似然得分。
- 与 SODEN 和 Cox-Time 相比,SuMo-net 实现了 20–100 倍的推理速度提升,METABRIC 上的推理时间低至 0.016 秒,SUPPORT 上为 0.047 秒。
- SuMo-net 产生校准良好的生存预测,在 METABRIC 上校准误差低至 0.097,在 KKBOX 上为 0.112,优于 Weibull 和对数正态等参数模型。
- 该模型在多种不同类型数据上表现稳健,并可扩展至包含数百万条记录的数据集,展示了在真实世界场景中的实际适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。