[论文解读] Beyond temperature scaling: Obtaining well-calibrated multiclass probabilities with Dirichlet calibration
本文提出 Dirichlet 校准,一种原生多分类事后校准方法,通过学习基于 Dirichlet 的校准映射,为任意分类器产生良好校准的多分类概率,在许多设置中优于温度缩放。
Class probabilities predicted by most multiclass classifiers are uncalibrated, often tending towards over-confidence. With neural networks, calibration can be improved by temperature scaling, a method to learn a single corrective multiplicative factor for inputs to the last softmax layer. On non-neural models the existing methods apply binary calibration in a pairwise or one-vs-rest fashion. We propose a natively multiclass calibration method applicable to classifiers from any model class, derived from Dirichlet distributions and generalising the beta calibration method from binary classification. It is easily implemented with neural nets since it is equivalent to log-transforming the uncalibrated probabilities, followed by one linear layer and softmax. Experiments demonstrate improved probabilistic predictions according to multiple measures (confidence-ECE, classwise-ECE, log-loss, Brier score) across a wide range of datasets and classifiers. Parameters of the learned Dirichlet calibration map provide insights to the biases in the uncalibrated model.
研究动机与目标
- 澄清多分类设置下的基本校准概念,并突出现有方法的局限性。
- 引入基于 Dirichlet 分布的原生多分类校准方法。
- 提供实用、可实现的带可解释性的校准映射参数化。
- 在多种数据集和指标下,对 Dirichlet 校准在非神经网络和神经网络模型上的表现进行评估。
提出的方法
- 提出 Dirichlet 校准,通过将 P(p̂(X)|Y=j) 模型化为 Dirichlet(α^(j)),适用于每个类别 j。
- 用贝叶斯公式推导一个规范的校准函数 μ̂_Dir(q),具有生成形式以及两种等价的参数化:线性形式 μ̂_DirLin(q;W,b) = σ(W ln q + b) 和规范形式 μ̂_Dir(q;A,c) = σ(A ln(q/1/k) + ln c)。
- 证明三种参数化(DirGen、DirLin、Dir)之间的等价性。
- 通过概率简单形上的解释点提供对规范形式的可解释性,并分析矩阵 A 和向量 c 如何影响校准与类别混淆边界。
- 引入 Off-Diagonal and Intercept Regularisation (ODIR) 来对抗在对深度网络进行校准时的过拟合,将其加入对数损失目标中,形式为 L = (1/n)∑ logloss(μ̂_DirLin(p̂(xi)); yi) + λ(1/(k(k−1))∑i≠j wij^2) + μ(1/k)∑j bj^2。
- 在标准框架中提供直接实现(例如先对数变换层再接一个密集层和 softmax),并指出对零概率的裁剪。
实验结果
研究问题
- RQ1在多分类设置中,原生多分类校准映射是否能超越二元/单一类别校准的方法?
- RQ2基于 Dirichlet 校准的映射是否在不同数据集和模型家族上优于温度缩放?
- RQ3所提 OD 正则化对于防止深度网络高参数校准中的过拟合是否必不可少?
- RQ4当在 logits 与概率上进行校准时,Dirichlet 校准映射与矩阵缩放(matrix scaling)和向量缩放(vector scaling)相比如何?
- RQ5从规范参数化中可以获得哪些关于类别偏置和混淆模式的可解释性洞见?
主要发现
- Dirichlet_L2 在非神经网络模型和数据集上通常表现良好,常居最佳校准器之列。
- Dirichlet_ODIR(带 OD 正则化)在深度网络上经常优于温度缩放,特别是在类别级别校准(cw-ECE)方面。
- 在 CIFAR-10 上,Dirichlet 变体在 cw-ECE 和若干设置中在对数损失上优于温度缩放;在 CIFAR-100 上,Dir-ODIR 将 cw-ECE 相对于 TempS 提升,尽管对数损失可能略有上升。
- 带 ODIR 的矩阵缩放在某些指标上可能超越 Dir-ODIR,但捕获对角线以外的类别依赖的好处在若干情况下明显(例如在建模成对效应时对数损失的提升)。
- ODIR 正则化可以缓解过拟合,帮助在高维校准映射(例如 100 个类别)上维持校准质量。
- 校准映射通过显示校准参数如何使概率向简化形上的规范点偏移来提供可解释性;解释点包括简单形的中心和面中心。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。