[论文解读] Distance-Based Learning from Errors for Confidence Calibration
本文提出了一种基于距离的错误学习(DBLE)方法,这是一种新颖的训练策略,通过学习基于距离的表示空间并仅使用误分类样本联合训练置信度模型,从而提升深度神经网络的置信度校准性能。DBLE 在计算成本低于集成方法的同时,实现了单模型置信度校准的最先进性能,且未牺牲分类性能。
Deep neural networks (DNNs) are poorly calibrated when trained in conventional ways. To improve confidence calibration of DNNs, we propose a novel training method, distance-based learning from errors (DBLE). DBLE bases its confidence estimation on distances in the representation space. In DBLE, we first adapt prototypical learning to train classification models. It yields a representation space where the distance between a test sample and its ground truth class center can calibrate the model's classification performance. At inference, however, these distances are not available due to the lack of ground truth labels. To circumvent this by inferring the distance for every test sample, we propose to train a confidence model jointly with the classification model. We integrate this into training by merely learning from mis-classified training samples, which we show to be highly beneficial for effective learning. On multiple datasets and DNN architectures, we demonstrate that DBLE outperforms alternative single-model confidence calibration approaches. DBLE also achieves comparable performance with computationally-expensive ensemble approaches with lower computational cost and lower number of parameters.
研究动机与目标
- 解决使用标准交叉熵损失训练的深度神经网络置信度校准性能差的问题。
- 开发一种训练方法,实现在不依赖后处理校准或集成方法的前提下实现良好置信度估计。
- 通过利用表示空间中的距离并从误分类样本中学习,提升校准性能。
- 与现有方法相比,实现高置信度校准性能的同时计算开销最小化。
提出的方法
- DBLE 将原型学习方法适配到基于距离的表示空间中,使测试样本到其真实类别中心的距离与模型性能相关联。
- 在推理阶段,由于真实标签不可用,因此与分类模型联合训练一个独立的置信度模型,以估计到真实类别中心的距离。
- 置信度模型仅在误分类的训练样本上进行训练,损失函数旨在最大化错误预测的估计距离。
- 该方法在每个训练步骤中执行两次前向传播:一次用于分类模型,一次用于置信度模型,且置信度模型仅在错误样本上进行更新。
- 置信度模型实现为一个小型多层感知机(MLP),仅增加主模型 1%–3% 的参数量。
- 训练采用标准优化方法并配合学习率调度,置信度模型使用估计距离的负对数似然目标进行更新。
实验结果
研究问题
- RQ1基于距离的表示空间是否能改善深度神经网络的置信度校准?
- RQ2从误分类样本中学习是否能在不增加计算成本的前提下提升置信度模型性能?
- RQ3联合训练的置信度模型能否在参数量更少、训练时间更短的情况下,实现与深度集成相当的校准性能?
- RQ4DBLE 与后处理校准和贝叶斯深度学习方法相比,在校准性能和推理效率方面表现如何?
主要发现
- 在 CIFAR-100 与 ResNet50 上,DBLE 实现了 3.6% 的期望校准误差(ECE),显著优于原始训练(25.2%)和其他基线方法。
- 在 Tiny-ImageNet 上,DBLE 将 ECE 降低至 3.6%,而原始训练为 25.2%,表明其在不同数据集上均具有一致的性能提升。
- 在 CIFAR-100-VGG11 上,DBLE 实现了 1.1% 的 ECE,优于 MC-dropout 和温度缩放方法,并接近深度集成的性能。
- DBLE 的训练时间在 CIFAR-100-VGG11 上为原始训练的 1.4 倍,在 CIFAR-100-ResNet50 上为 1.7 倍,而四网络深度集成的训练时间是原始训练的 4 倍。
- 置信度模型仅增加主模型 1%–3% 的参数量,而深度集成使参数量增加 400%。
- 消融实验表明,基于距离的表示空间和基于错误的学习均至关重要——若使用全部训练样本进行置信度训练,性能会下降;而仅使用错误样本进行训练的原始训练方法仅带来微小提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。