Skip to main content
QUICK REVIEW

[论文解读] On Calibrated Model Uncertainty in Deep Learning

Biraja Ghoshal, Allan Tucker|arXiv (Cornell University)|Jun 15, 2022
Anomaly Detection Techniques and Applications被引用 6
一句话总结

本文提出一种基于 dropweights 的损失校准贝叶斯神经网络,以改善深度学习中模型不确定性校准问题,尤其适用于医学诊断。通过在后验分布上最大化期望效用,该方法减少了不确定性校准偏差,特别是在新冠X光片检测中的假阴性问题,同时保持高准确率,并实现1.91的最高不确定性校准误差(MUCE),显著优于标准模型。

ABSTRACT

Estimated uncertainty by approximate posteriors in Bayesian neural networks are prone to miscalibration, which leads to overconfident predictions in critical tasks that have a clear asymmetric cost or significant losses. Here, we extend the approximate inference for the loss-calibrated Bayesian framework to dropweights based Bayesian neural networks by maximising expected utility over a model posterior to calibrate uncertainty in deep learning. Furthermore, we show that decisions informed by loss-calibrated uncertainty can improve diagnostic performance to a greater extent than straightforward alternatives. We propose Maximum Uncertainty Calibration Error (MUCE) as a metric to measure calibrated confidence, in addition to its prediction especially for high-risk applications, where the goal is to minimise the worst-case deviation between error and estimated uncertainty. In experiments, we show the correlation between error in prediction and estimated uncertainty by interpreting Wasserstein distance as the accuracy of prediction. We evaluated the effectiveness of our approach to detecting Covid-19 from X-Ray images. Experimental results show that our method reduces miscalibration considerably, without impacting the models accuracy and improves reliability of computer-based diagnostics.

研究动机与目标

  • 解决贝叶斯神经网络中的校准偏差问题,即估计的不确定性与实际预测误差不匹配,尤其在医学诊断等高风险应用中。
  • 通过引入任务特定的非对称效用函数,提升深度学习中的决策可靠性,特别是最小化疾病检测中代价高昂的假阴性。
  • 开发一种保持模型准确率的同时减少预测过度自信的校准不确定性估计方法。
  • 评估损失校准不确定性在真实世界医学影像中的有效性,特别是基于X光片的新冠检测。
  • 提出并验证一种新指标——最高不确定性校准误差(MUCE),用于衡量高风险预测任务中的校准置信度。

提出的方法

  • 将损失校准贝叶斯框架中的近似推理扩展至基于 dropweights 的贝叶斯神经网络,通过效用驱动的后验近似实现不确定性校准。
  • 在标准证据下界(ELBO)损失中引入一种新型惩罚项,结合任务特定的效用函数,对随机优化进行正则化。
  • 使用蒙特卡洛 dropout(MC-Dropweights)近似网络权重的后验分布,实现在训练和推理过程中均能进行不确定性估计。
  • 采用两步流程:首先近似后验 $ q(\theta|D) $,然后在后验上优化期望效用,以最小化后验风险。
  • 使用 Wasserstein 距离作为预测误差与估计不确定性之间相关性的度量,以评估校准偏差。
  • 提出最高不确定性校准误差(MUCE)作为指标,量化估计不确定性与实际误差之间的最坏情况偏差,尤其适用于高风险决策。

实验结果

研究问题

  • RQ1基于 dropweights 的损失校准贝叶斯神经网络是否能减少深度学习模型中的校准偏差,特别是在医学影像任务中?
  • RQ2引入任务特定的效用函数在非对称误分类代价的模型中,如何改善不确定性校准和决策可靠性?
  • RQ3与标准模型相比,该方法在基于X光片的新冠检测中,能将假阴性预测减少到何种程度?
  • RQ4所提出的最高不确定性校准误差(MUCE)指标与实际预测误差及模型可靠性之间的相关性如何?
  • RQ5损失校准方法是否在显著减少不确定性校准偏差的同时,保持或提升模型准确率?

主要发现

  • 采用 MC-Dropweights 的损失校准 BNN 实现了 1.91 的 MUCE,显著低于标准 BNN(3.77)和加权交叉熵模型(5.42),表明其具有更优的不确定性校准性能。
  • 该方法将期望校准误差(ECE)降低至 7.01,远低于标准 BNN 的 13.27,表明置信度校准性能得到显著提升。
  • 准确率提升至 80.88%,优于标准 BNN(70.12%)和加权交叉熵模型(74.09%)。
  • 通过 Wasserstein 距离测量,估计不确定性与预测误差之间表现出强相关性,表明校准偏差显著降低。
  • 可靠性图显示,损失校准模型的置信度与不确定性估计更符合实际准确率,尤其在高风险预测区间表现更优。
  • 该方法有效减少了将新冠患者错误分类为“正常”的常见失败模式,显著提升了临床决策支持的安全性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。