[论文解读] Better Uncertainty Calibration via Proper Scores for Classification and Beyond
本文提出了一种新颖的校准误差框架,将校准度量与严格评分规则联系起来,从而在深度学习中实现对不确定性校准改进的一致且可靠的估计。通过利用严格评分,该方法克服了传统估计器在低数据场景下的偏差和不一致性,将校准重新校准的适用范围从分类扩展到回归及其他任务,显著提升了鲁棒性和准确性。
With model trustworthiness being crucial for sensitive real-world applications, practitioners are putting more and more focus on improving the uncertainty calibration of deep neural networks. Calibration errors are designed to quantify the reliability of probabilistic predictions but their estimators are usually biased and inconsistent. In this work, we introduce the framework of proper calibration errors, which relates every calibration error to a proper score and provides a respective upper bound with optimal estimation properties. This relationship can be used to reliably quantify the model calibration improvement. We theoretically and empirically demonstrate the shortcomings of commonly used estimators compared to our approach. Due to the wide applicability of proper scores, this gives a natural extension of recalibration beyond classification.
研究动机与目标
- 解决医疗诊断和气候预测等高风险应用中对可靠不确定性校准的迫切需求。
- 识别现有校准误差估计器的根本缺陷,这些估计器在小测试集下存在偏差和不一致性。
- 开发一个统一框架,将校准误差与严格评分规则联系起来,以确保理论保证和改进的估计特性。
- 利用严格评分框架,将校准重新校准从分类扩展到回归及其他概率预测任务。
- 提供一种鲁棒、一致且可靠的校准改进量化方法,即使在医学和科学应用中常见的低数据场景下也适用。
提出的方法
- 引入严格校准误差的概念,其中每种校准误差都与一个严格评分规则正式关联,确保理论一致性与最优估计特性。
- 使用严格评分(如DSS,即评分发散性得分)作为定义校准误差的基础,确保在模型假设正确时估计的一致性和无偏性。
- 应用单射重新校准方法(如Platt缩放),并证明通过相关严格评分进行优化等价于最小化相应的校准误差。
- 证明严格评分(如DSS和SKCE)可用于评估和改进分类与回归设置中的不确定性校准。
- 在多种数据集(CIFAR-10、CIFAR-100、ImageNet、UCI Residential、Friedman 1)上实现并验证该框架,使用混合密度网络进行回归中的方差预测。
- 通过重采样和多组随机种子评估估计稳定性与鲁棒性,涵盖不同测试集大小,突出严格评分估计器的优越性。
实验结果
研究问题
- RQ1为何常用校准误差估计器(如ECE和KDE CE)在低数据场景下存在偏差和不一致性?
- RQ2如何重新定义校准误差,以确保在不确定性量化中具有一致性和最优估计特性?
- RQ3严格评分在多大程度上可用于定义在分类之外也具有鲁棒性和泛化能力的校准误差?
- RQ4所提出的框架在分类和回归任务中如何提升校准改进的估计性能?
- RQ5在测试集规模较小时,基于严格评分的校准度量能否可靠检测并量化不确定性校准的改进?
主要发现
- 如ECE和KDE CE等常用校准估计器在小测试集下表现出强烈偏差和不一致性,导致对校准改进的高估或低估。
- 所提出的基于严格评分规则的严格校准误差框架,即使在数据有限的情况下,也能提供一致且可靠的校准改进估计。
- DSS(评分发散性得分)在分类和回归中均能稳定捕捉校准改进效应,而SKCE无法反映与方差相关的改进,且表现不稳定。
- 在具有可变预测方差的回归任务中(如修改后的Friedman 1),基于严格评分的校准能有效纠正方差预测中的过拟合,提升不确定性表达能力。
- 该框架实现了准确的单射重新校准,在保持预测准确性的同时改善校准性能,经多个数据集和模型架构验证。
- 实证结果表明,基于严格评分的估计器(如DSS)对测试集大小变化具有鲁棒性,而传统估计器则随样本减少而单调恶化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。