Skip to main content
QUICK REVIEW

[论文解读] Calibration of Neural Networks using Splines

Kartik Gupta, Amir Rahimi|arXiv (Cornell University)|Jun 23, 2020
Adversarial Robustness in Machine Learning参考文献 30被引用 4
一句话总结

本文提出了一种基于Kolmogorov-Smirnov (KS)检验的无分箱校准方法,通过样条拟合从校准集导出的累积分布函数,实现神经网络的无学习校准。通过在保留校准集上使用可微分样条逼近经验累积分布函数,该方法学习到一个直接的、非学习型的校准函数,将原始网络输出映射为校准良好的概率,跨多个数据集和模型架构始终实现<1%的KS误差,优于当前最先进的后处理校准技术。

ABSTRACT

Calibrating neural networks is of utmost importance when employing them in safety-critical applications where the downstream decision making depends on the predicted probabilities. Measuring calibration error amounts to comparing two empirical distributions. In this work, we introduce a binning-free calibration measure inspired by the classical Kolmogorov-Smirnov (KS) statistical test in which the main idea is to compare the respective cumulative probability distributions. From this, by approximating the empirical cumulative distribution using a differentiable function via splines, we obtain a recalibration function, which maps the network outputs to actual (calibrated) class assignment probabilities. The spine-fitting is performed using a held-out calibration set and the obtained recalibration function is evaluated on an unseen test set. We tested our method against existing calibration approaches on various image classification datasets and our spline-based recalibration approach consistently outperforms existing methods on KS error as well as other commonly used calibration measures. Our Code is available at https://github.com/kartikgupta-at-anu/spline-calibration.

研究动机与目标

  • 解决基于直方图的校准度量(如期望校准误差ECE)依赖于任意分箱方案的局限性。
  • 开发一种基于Kolmogorov-Smirnov (KS)检验的无分箱、可视化友好的校准度量,用于衡量类别级或top-r预测的校准性。
  • 设计一种非学习型、可微分的校准函数,通过在保留校准集上进行样条拟合,将原始网络输出映射为校准良好的概率。
  • 在多样化的图像分类数据集和模型架构上评估该方法,证明其在现有后处理校准技术中持续领先。
  • 在显著降低top-1和top-2预测校准误差的同时,保持原始模型的分类精度。

提出的方法

  • 通过比较预测类别概率与真实类别概率的经验累积分布函数,基于KS检验提出一种无分箱校准度量。
  • 使用自然样条(natural cubic splines)逼近网络输出的经验累积分布函数,实现可微分且平滑的校准。
  • 在保留校准集上拟合样条,学习一个将原始logits映射为校准概率的校准函数,且不更新模型参数。
  • 将学习到的校准函数应用于未见的测试数据,使用KS误差及其他标准度量评估校准性能。
  • 所有实验中均采用固定六组节点(knots)进行样条拟合,确保校准的一致性与稳定性。
  • 使用公开存储库中的预训练网络logits评估该方法,在校准过程中保持原始模型精度。

实验结果

研究问题

  • RQ1基于KS检验的无分箱校准度量是否能比基于直方图的度量(如ECE)提供更鲁棒、更一致的神经网络校准度量?
  • RQ2对经验累积分布函数进行样条拟合是否能生成一种可微分、非学习型的校准函数,从而在不微调网络的情况下提升校准性能?
  • RQ3所提出的基于样条的校准方法与当前最先进的后处理校准技术(如温度缩放和Dirichlet校准)相比,在多样化的数据集和模型架构上表现如何?
  • RQ4该方法是否在实现近乎完美的校准的同时,仍能保持高分类精度,特别是在ImageNet等大规模数据集上?
  • RQ5该方法是否能有效校准top-1以外的top-2和top-3预测,确保在多个预测排名上的鲁棒性?

主要发现

  • 所提出的基于样条的校准方法在所有评估的数据集和模型上均实现低于1%的KS误差,仅在一种情况下达到0.7%。
  • 该方法在KS误差方面始终优于温度缩放、向量缩放、带ODIR的矩阵缩放以及Dirichlet校准,尤其在大规模ImageNet数据集上表现更优。
  • 在13项实验中的9项,该方法的KS误差低于温度缩放(最接近的竞争对手),在边缘情况下差异小于0.3%。
  • 在top-2预测校准方面,该方法在所有实验中均将校准误差保持在1%以下,在ImageNet上创下新的SOTA纪录。
  • 在所有测试案例中,该方法均保持了原始模型的分类精度,因其不进行微调或参数更新。
  • 基于KS的校准度量提供了类似可靠性图的有效可视化,同时消除了ECE固有的分箱依赖性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。