Skip to main content
QUICK REVIEW

[论文解读] A Consistent and Differentiable Lp Canonical Calibration Error Estimator

Teodora Popordanoska, Raphael Sayer|arXiv (Cornell University)|Oct 13, 2022
Adversarial Robustness in Machine Learning被引用 9
一句话总结

本文提出了一种一致、可微且可处理的 $L_p$ 标准校准误差估计器,用于多分类概率分类器,采用狄利克雷核密度估计。该方法具有 $ olimits^{\mathcal{O}(n^2)}$ 的复杂度和 $ olimits^{\mathcal{O}(n^{-1/2})}$ 的收敛速率,支持高效的小批量训练与正则化,同时在完整分布校准方面,其一致性与可扩展性优于现有估计器。

ABSTRACT

Calibrated probabilistic classifiers are models whose predicted probabilities can directly be interpreted as uncertainty estimates. It has been shown recently that deep neural networks are poorly calibrated and tend to output overconfident predictions. As a remedy, we propose a low-bias, trainable calibration error estimator based on Dirichlet kernel density estimates, which asymptotically converges to the true $L_p$ calibration error. This novel estimator enables us to tackle the strongest notion of multiclass calibration, called canonical (or distribution) calibration, while other common calibration methods are tractable only for top-label and marginal calibration. The computational complexity of our estimator is $\mathcal{O}(n^2)$, the convergence rate is $\mathcal{O}(n^{-1/2})$, and it is unbiased up to $\mathcal{O}(n^{-2})$, achieved by a geometric series debiasing scheme. In practice, this means that the estimator can be applied to small subsets of data, enabling efficient estimation and mini-batch updates. The proposed method has a natural choice of kernel, and can be used to generate consistent estimates of other quantities based on conditional expectation, such as the sharpness of a probabilistic classifier. Empirical results validate the correctness of our estimator, and demonstrate its utility in canonical calibration error estimation and calibration error regularized risk minimization.

研究动机与目标

  • 解决多分类设置下标准(分布)校准缺乏一致、可微且可扩展估计器的问题。
  • 克服现有方法(如分箱估计器(不一致)、MMCE(不一致)和 Mix-n-Match(高维下不可处理))的局限性。
  • 通过提供一个可微且一致的损失函数,实现端到端校准误差正则化训练。
  • 开发一种基于几何级数的去偏方案,将偏差降低至 $\mathcal{O}(n^{-2})$,以改善有限样本性能。
  • 展示该估计器在多样化架构与数据集上的校准正则化风险最小化中的实用性。

提出的方法

  • 在概率单纯形域上使用狄利克雷核密度估计(KDE)与自然核选择,实现对条件类别概率的精确密度估计。
  • 采用基于几何级数的去偏方案,将偏差从 $\mathcal{O}(n^{-1})$ 降低至 $\mathcal{O}(n^{-2})$,提升有限样本下的准确性。
  • 通过在单纯形上对预测与真实条件概率之差的 $L_p$ 范数进行积分,推导出可微的 $L_p$ 标准校准误差估计器。
  • 采用留一法最大似然法进行带宽选择,并在对比中使用 Doane 公式进行分箱,确保评估的公平性。
  • 利用估计器的可微性,支持小批量更新,适用于校准正则化训练中的随机优化。
  • 将框架扩展至基于条件期望公式的相关量(如锐度)的估计。

实验结果

研究问题

  • RQ1能否构建一个一致且可微的 $L_p$ 标准校准误差估计器,使其可扩展至高维概率单纯形?
  • RQ2与标准分箱估计器(如 $ECE^{bin}$)相比,所提出的基于 KDE 的估计器在偏差与收敛速率方面表现如何?
  • RQ3基于几何级数的去偏方案在多大程度上改善了校准误差估计器的有限样本性能?
  • RQ4该估计器能否在校准正则化风险最小化中有效应用,以提升模型校准性而不损失准确性?
  • RQ5该估计器在多样化深度学习架构与多分类数据集上是否具备鲁棒性与可靠性?

主要发现

  • 所提出的 $ECE^{KDE}$ 估计器实现了渐近一致性与 $\mathcal{O}(n^{-1/2})$ 的收敛速率,符合理论预期。
  • 该估计器的偏差与收敛行为与 $ECE^{bin}$ 相当,但具备可微性与高维可扩展性的额外优势。
  • 基于几何级数的去偏方案将偏差降低至 $\mathcal{O}(n^{-2})$,显著提升了有限样本下的准确性。
  • 实验结果表明,$ECE^{KDE}$ 在多个数据集(包括 CIFAR-10 与 CIFAR-100)上提供了稳定一致的估计,且在不同样本规模下表现稳健。
  • 在校准正则化训练中,该方法显著改善了模型校准性(例如,在 ResNet-110 上将 CIFAR-100 的 $ECE$ 从 12.769 降低至 8.969),同时保持高准确率。
  • 该估计器支持有效的批量更新,适用于深度学习流水线中的端到端训练。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。