Skip to main content
QUICK REVIEW

[论文解读] Selective prediction-set models with coverage guarantees

Jean Feng, Arjun Sondhi|arXiv (Cornell University)|Jun 13, 2019
Machine Learning in Healthcare参考文献 25被引用 12
一句话总结

本文提出了一种惩罚损失最小化框架,用于训练选择性预测集(SPS)模型,使其能够输出预测集或选择不预测,通过避免高不确定性预测来提高可靠性。利用K折交叉验证集成多个模型,该方法在MNIST图像分类和ICU患者风险预测任务中,均实现了更接近名义水平的覆盖率以及更窄的置信区间,优于现有方法。

ABSTRACT

Though black-box predictors are state-of-the-art for many complex tasks, they often fail to properly quantify predictive uncertainty and may provide inappropriate predictions for unfamiliar data. Instead, we can learn more reliable models by letting them either output a prediction set or abstain when the uncertainty is high. We propose training these selective prediction-set models using an uncertainty-aware loss minimization framework, which unifies ideas from decision theory and robust maximum likelihood. Moreover, since black-box methods are not guaranteed to output well-calibrated prediction sets, we show how to calculate point estimates and confidence intervals for the true coverage of any selective prediction-set model, as well as a uniform mixture of K set models obtained from K-fold sample-splitting. When applied to predicting in-hospital mortality and length-of-stay for ICU patients, our model outperforms existing approaches on both in-sample and out-of-sample age groups, and our recalibration method provides accurate inference for prediction set coverage.

研究动机与目标

  • 开发一种通用框架,用于训练机器学习模型,使其在不确定性较高时选择不预测,从而提高可靠性并减轻临床医生的负担。
  • 解决现有基于机器学习的临床预测模型缺乏理论覆盖保证的问题,尤其是在高风险医疗环境中。
  • 使模型能够输出预测集而非点估计,为临床决策提供更好的不确定性量化。
  • 提出一种模型无关的统计推断程序,利用K折交叉验证估计边际覆盖率,提高估计精度。
  • 在真实世界医疗数据集上实证验证该方法,展示其在准确性和覆盖稳定性方面的改进。

提出的方法

  • 提出一种惩罚经验损失函数,联合优化预测准确性和不预测行为,鼓励模型在分布外或难以预测的样本上选择不预测。
  • 引入统一的接受惩罚,以促进不同数据子群体间条件覆盖的一致性。
  • 使用K折交叉验证训练多个SPS模型,然后对它们进行集成,以改进边际覆盖率估计。
  • 应用归纳性推断原理,构建具有有限样本覆盖保证的有效预测集。
  • 利用K折模型的聚合预测结果,对集成模型的边际覆盖率进行统计推断。
  • 在MNIST和MIMIC-III数据集上,使用pSPS目标训练深度神经网络,以评估性能和覆盖情况。

实验结果

研究问题

  • RQ1统一的惩罚损失框架是否能够训练机器学习模型,实现选择性输出预测集或不预测,从而在医疗应用中提高可靠性?
  • RQ2与单次划分验证相比,基于K折交叉验证的SPS模型集成在边际覆盖率估计的准确性和精度方面有何影响?
  • RQ3pSPS模型在分布外或复杂病例上选择不预测,能在多大程度上提升预测准确性,特别是在临床环境中?
  • RQ4与现有方法相比,所提出的方法是否能实现更接近名义水平的覆盖率,特别是在真实世界的ICU患者预测任务中?
  • RQ5该模型无关的推断程序是否能够可靠地估计通过黑箱方法训练的SPS模型的边际覆盖率?

主要发现

  • 在住院死亡率任务中,pSPS模型的测试损失为0.3768(0.006),在住院时长任务中为0.2163(0.002),优于基线方法。
  • 在住院死亡率任务中,pSPS模型的接受率为51.44%(2.44),边际覆盖率估计值为0.768(0.047),接近名义水平0.75。
  • 在住院时长任务中,pSPS模型的边际覆盖率估计值为0.759(0.007),95%置信区间为(0.752, 0.766),与测试覆盖率0.756非常接近。
  • 集成模型的边际覆盖率置信区间宽度约为单个模型的一半,表明估计更加精确。
  • pSPS模型在两个任务中均对年轻患者更频繁地选择不预测,从而在被接受的样本上实现更低的测试损失和更高的准确性。
  • 在MIMIC-III数据集中,LOS任务的最终pSPS模型对年轻患者分配了显著更低的接受概率,这是由于其更高的变异性,反映出更好的校准性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。