[论文解读] Soft Calibration Objectives for Neural Networks
本文提出基于可微分软分箱的校准目标——SB-ECE 和 S-AvUC,使神经网络能够端到端训练以提升预测不确定性校准性能。通过用连续、重叠的分箱替代离散分箱,该方法在仅损失不到1%准确率的情况下实现了最先进水平的期望校准误差(ECE),优于标准交叉熵训练和后处理方法(如温度缩放),尤其在分布偏移情况下表现更优。
Optimal decision making requires that classifiers produce uncertainty estimates consistent with their empirical accuracy. However, deep neural networks are often under- or over-confident in their predictions. Consequently, methods have been developed to improve the calibration of their predictive uncertainty both during training and post-hoc. In this work, we propose differentiable losses to improve calibration based on a soft (continuous) version of the binning operation underlying popular calibration-error estimators. When incorporated into training, these soft calibration losses achieve state-of-the-art single-model ECE across multiple datasets with less than 1% decrease in accuracy. For instance, we observe an 82% reduction in ECE (70% relative to the post-hoc rescaled ECE) in exchange for a 0.7% relative decrease in accuracy relative to the cross entropy baseline on CIFAR-100. When incorporated post-training, the soft-binning-based calibration error objective improves upon temperature scaling, a popular recalibration method. Overall, experiments across losses and datasets demonstrate that using calibration-sensitive procedures yield better uncertainty estimates under dataset shift than the standard practice of using a cross entropy loss and post-hoc recalibration methods.
研究动机与目标
- 为解决深度神经网络校准性能差的问题,这些网络尽管准确率高,却常产生过度自信或不自信的预测。
- 克服标准校准误差估计器(如ECE)因离散分箱导致不可微的局限,从而无法进行基于梯度的优化。
- 开发硬分箱的可微分、连续替代方法,以估计校准误差,实现训练期间的直接优化以及后处理校准。
- 通过使用对校准敏感的训练目标,而非标准交叉熵损失加后处理方法,提升在分布偏移下的不确定性估计性能。
- 证明软校准目标在分布内和分布外设置下,均能比传统方法更好地泛化不确定性估计。
提出的方法
- 提出一种软分箱机制,通过可微分核函数(如高斯核)将置信度分数映射到重叠的连续分箱,替代离散的硬分箱。
- 通过在连续分箱上计算加权积分来定义期望校准误差的软版本(SB-ECE),实现梯度计算。
- 提出AvUC损失的软变体S-AvUC,作为非贝叶斯神经网络中改善校准的辅助训练目标。
- 采用交错训练策略,即使主损失(如交叉熵)导致记忆化现象,也能应用软校准目标,保持低ECE且不损失准确率。
- 在后处理校准中将软校准目标作为主损失,直接优化温度参数以最小化SB-ECE(即TS-SB-ECE),而非对数似然。
- 采用等质量分箱并使用ℓ₂范数计算ECE,并在CIFAR-10、CIFAR-100和ImageNet上评估不同主损失和数据偏移条件下的性能。
实验结果
研究问题
- RQ1可微分、连续的分箱是否能改善神经网络训练过程中校准误差的优化?
- RQ2将软校准目标(SB-ECE、S-AvUC)作为辅助损失,与现有校准激励损失相比,能否更有效地降低期望校准误差(ECE)?
- RQ3在后处理校准中优化软校准误差(如通过TS-SB-ECE)是否优于标准温度缩放?
- RQ4与标准交叉熵训练加后处理温度缩放相比,软校准目标在数据分布偏移下的泛化能力如何?
- RQ5软校准目标能否在多分类设置中同时改善top-label和边缘校准误差?
主要发现
- S-AvUC作为辅助损失在所有数据集和主损失上均实现ECE的最大改善,Cohen's d效应量表明改善程度为大到极大。
- 在CIFAR-100上,该方法将ECE降低82%(相对于后处理重标定ECE降低70%),同时相比交叉熵基线仅造成0.7%的相对准确率下降。
- TS-SB-ECE(后处理校准中使用软校准误差的方法)在所有数据集和校准误差度量上均持续优于标准温度缩放。
- 软校准目标在分布偏移下的泛化能力优于标准交叉熵训练加后处理温度缩放。
- 即使在交叉熵训练导致记忆化(训练准确率为100%)的情况下,通过交错训练,软校准目标仍能降低测试ECE。
- 该方法在CIFAR-10、CIFAR-100和ImageNet上实现了单模型SOTA的ECE水平,且准确率损失低于1%,展现出优异的校准-准确率权衡效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。