Skip to main content
QUICK REVIEW

[论文解读] Calibration of Neural Networks

Ruslan Vasilev, A. G. D’yakonov|arXiv (Cornell University)|Mar 19, 2023
Neural Networks and Applications被引用 4
一句话总结

本文对神经网络的置信度校准方法进行了全面综述与实证评估,比较了事后校准技术(如直方图分箱、等渗回归和温度缩放)与使用改进损失函数的训练时方法。主要贡献是在多种数据集和模型架构上进行系统性基准测试,结果表明温度缩放和改进的交叉熵损失显著提升了校准效果,其中 V-scaling 和 M-scaling-b 方法在 CIFAR-100 和 TinyImageNet 上实现了最先进的 Brier 得分。

ABSTRACT

Neural networks solving real-world problems are often required not only to make accurate predictions but also to provide a confidence level in the forecast. The calibration of a model indicates how close the estimated confidence is to the true probability. This paper presents a survey of confidence calibration problems in the context of neural networks and provides an empirical comparison of calibration methods. We analyze problem statement, calibration definitions, and different approaches to evaluation: visualizations and scalar measures that estimate whether the model is well-calibrated. We review modern calibration techniques: based on post-processing or requiring changes in training. Empirical experiments cover various datasets and models, comparing calibration methods according to different criteria.

研究动机与目标

  • 解决在医疗和自动驾驶等实际应用中对神经网络预测置信度估计可靠性的重要需求。
  • 系统性地评估并比较现有校准方法——包括事后与基于训练的方法——在现代深度学习架构上的表现。
  • 在多个数据集(CIFAR-10、CIFAR-100、TinyImageNet、ImageNet)和模型上建立统一的实证基准,以评估在不同条件下的校准性能。
  • 分析不同损失函数(交叉熵、焦点损失、标签平滑)对模型校准与泛化能力的影响。
  • 建立清晰的校准评估方法,结合可视化手段(可靠性图)与标量指标(Brier 得分、ECE)。

提出的方法

  • 通过形式化标准定义模型校准:对所有 p ∈ [0,1],有 P(y = ŷ | ŷ 置信度 = p) = p,确保预测置信度与真实准确率一致。
  • 使用可靠性图(校准曲线)通过将置信度分数分箱并绘制各箱的平均置信度与实际准确率,来直观评估校准效果。
  • 应用标量指标如期望校准误差(ECE)和 Brier 得分来定量评估校准质量,数值越低表示校准效果越好。
  • 实现事后校准技术,包括直方图分箱、等渗回归和温度缩放(T-scaling),这些方法学习对 logits 进行单调变换。
  • 引入并评估新型变体如 V-scaling 和 M-scaling-b,这些方法在 logits 上应用缩放并引入额外约束,以改善多分类问题中的校准效果。
  • 使用改进的损失函数(交叉熵、焦点损失(FL)、标签平滑(LS))训练模型,以评估其在无事后处理情况下的内在校准特性。

实验结果

研究问题

  • RQ1在不同神经网络架构上,各种事后校准方法(如直方图分箱、等渗回归、温度缩放)在校准性能上的表现如何比较?
  • RQ2训练时损失函数的修改(如焦点损失和标签平滑)对深度神经网络内在校准有何影响?
  • RQ3Brier 得分和期望校准误差(ECE)等校准指标与不同数据集和模型类型的可靠性图之间存在何种相关性?
  • RQ4模型架构与数据集复杂度(如 CIFAR-10 与 ImageNet)在多大程度上影响校准技术的有效性?
  • RQ5在多个基准测试中,哪种校准方法在提升校准效果与保持泛化性能之间实现了最佳平衡?

主要发现

  • 温度缩放(T-scaling)在所有数据集和模型上均一致优于直方图分箱和等渗回归,显著降低了期望校准误差(ECE)。
  • 使用焦点损失(FL)和标签平滑(LS)训练的模型相比标准交叉熵(CE),展现出显著更好的内在校准性能,Brier 得分在 CIFAR-100 上最高降低 20%。
  • 在 CIFAR-100 上,V-scaling-b 方法实现了最低的 Brier 得分 0.596,优于所有其他事后方法,甚至优于部分训练时基线方法。
  • 在 TinyImageNet 上,使用标签平滑(LS 0.05)的 ResNet50 模型获得了 0.621 的 Brier 得分,显著优于标准 CE 基线(0.645),证明了正则化的有效性。
  • V-scaling 和 M-scaling-b 方法在所有数据集上均表现出稳健性能,在 TinyImageNet 上 Brier 得分始终低于 0.7,在 MobileNetV2 上 ImageNet 上的 Brier 得分低于 0.32。
  • 可靠性图显示,使用焦点损失和标签平滑训练的模型表现出更平直、更接近对角线的校准曲线,表明预测置信度与实际准确率之间对齐更好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。