[论文解读] Revisiting the Evaluation of Uncertainty Estimation and Its Application to Explore Model Complexity-Uncertainty Trade-Off
本文识别出深度神经网络中不确定性估计标准度量(尤其是AUROC、AUPR、ECE和MCE)中的关键缺陷,并提出改进的替代方案:选择性预测使用AURC,置信度校准使用自适应分箱。作者证明,模型复杂度显著影响选择性预测中的不确定性质量,但对校准影响较小,揭示了一种此前未被探索的复杂度-不确定性权衡。
Accurately estimating uncertainties in neural network predictions is of great importance in building trusted DNNs-based models, and there is an increasing interest in providing accurate uncertainty estimation on many tasks, such as security cameras and autonomous driving vehicles. In this paper, we focus on the two main use cases of uncertainty estimation, i.e. selective prediction and confidence calibration. We first reveal potential issues of commonly used quality metrics for uncertainty estimation in both use cases, and propose our new metrics to mitigate them. We then apply these new metrics to explore the trade-off between model complexity and uncertainty estimation quality, a critically missing work in the literature. Our empirical experiment results validate the superiority of the proposed metrics, and some interesting trends about the complexity-uncertainty trade-off are observed.
研究动机与目标
- 识别深度学习中常用不确定性估计度量的缺陷。
- 提出AURC作为选择性预测的更可靠度量,解决在模型变化下AUROC和AUPR的缺陷。
- 引入自适应分箱以提升置信度校准评估的鲁棒性和准确性。
- 通过在分类和医学图像分割任务上的综合实验,实证研究模型复杂度与不确定性估计质量之间的权衡。
- 通过在多种任务和数据集上的实验验证所提度量的有效性。
提出的方法
- 提出风险-覆盖率曲线下方面积(AURC)作为选择性预测的新主要度量,其在模型变化下保持一致。
- 引入自适应分箱用于校准评估,根据置信度分布动态调整分箱边界,以减少内部补偿并提升准确性估计。
- 使用AURC和自适应分箱在CIFAR-10和CIFAR-100上对不同复杂度的模型(如WideResNet、DenseNet)重新评估不确定性估计。
- 将新度量应用于Whole Heart Segmentation数据集上的U-Net变体医学图像分割任务,以验证其泛化能力。
- 将基线度量(ECE、MCE)与自适应变体(AECE、AMCE)进行比较,评估其在不同模型架构和数据分布下的鲁棒性和可靠性。
- 进行理论分析,将选择性预测与置信度校准联系起来,以指导实证研究。
实验结果
研究问题
- RQ1为何在模型架构改变时,即使性能保持稳定,标准度量如AUROC和AUPR仍会变得具有误导性?
- RQ2与固定分箱相比,自适应分箱如何提升ECE和MCE等校准误差度量的可靠性?
- RQ3模型复杂度如何影响选择性预测与置信度校准中的不确定性估计质量?
- RQ4AURC能否作为比AUROC和AUPR更鲁棒、更一致的度量,用于评估选择性预测?
- RQ5随着模型规模增大,不确定性估计质量在不同任务和数据集上的经验趋势是什么?
主要发现
- 在评估选择性预测时,AURC在一致性和可靠性方面优于AUROC和AUPR,尤其在模型架构变化时表现更优。
- 自适应分箱减少了内部补偿,提升了准确性估计,使校准误差度量(AECE和AMCE)比标准ECE和MCE更具鲁棒性。
- AECE始终低于ECE,平均差异为0.005–0.01,表明自适应分箱下校准估计更优。
- 在CIFAR-100和CIFAR-10上,DenseNet的AMCE显著低于MCE,尤其在高置信度区域,归因于分箱改进和误差减少。
- 模型复杂度对选择性预测中的不确定性质量有显著影响,如AURC在不同模型规模下的趋势所示,但对置信度校准度量影响甚微。
- 在医学图像分割任务中,由于预测置信度高,ECE与AECE几乎相同,但MCE仍不稳定,凸显了标准分箱方法在小数据集中的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。