[论文解读] Calibrating Deep Neural Network Classifiers on Out-of-Distribution Datasets
本文提出CCAC(带辅助类的置信度校准),一种事后校准方法,通过引入一个辅助类将误分类样本与正确样本分离,从而在分布外(OOD)数据集上显著降低深度神经网络分类器的过度自信问题,提升其置信度估计的准确性。CCAC在图像和文本分类任务中,持续优于先前方法,在预期校准误差(ECE)和Brier评分方面表现更优,其简化变体CCAC-S可实现高效迁移至新的OOD数据集。
To increase the trustworthiness of deep neural network (DNN) classifiers, an accurate prediction confidence that represents the true likelihood of correctness is crucial. Towards this end, many post-hoc calibration methods have been proposed to leverage a lightweight model to map the target DNN's output layer into a calibrated confidence. Nonetheless, on an out-of-distribution (OOD) dataset in practice, the target DNN can often mis-classify samples with a high confidence, creating significant challenges for the existing calibration methods to produce an accurate confidence. In this paper, we propose a new post-hoc confidence calibration method, called CCAC (Confidence Calibration with an Auxiliary Class), for DNN classifiers on OOD datasets. The key novelty of CCAC is an auxiliary class in the calibration model which separates mis-classified samples from correctly classified ones, thus effectively mitigating the target DNN's being confidently wrong. We also propose a simplified version of CCAC to reduce free parameters and facilitate transfer to a new unseen dataset. Our experiments on different DNN models, datasets and applications show that CCAC can consistently outperform the prior post-hoc calibration methods.
研究动机与目标
- 解决深度神经网络分类器在部署于分布外(OOD)测试数据时出现过度自信预测的问题。
- 通过事后校准方法对模型输出进行校准,以提升预测置信度的可靠性,同时考虑OOD误分类情况。
- 开发一种即使在测试数据分布与训练分布显著偏离时仍保持有效性的校准方法。
- 实现在仅需少量标注数据的情况下,将校准模型高效迁移至新的、未见过的OOD数据集。
- 在保持OOD数据上高性能的同时,减少校准模型的自由参数数量。
提出的方法
- CCAC在校准头中引入一个辅助类,以显式建模误分类样本,从而在置信度估计过程中将误分类样本与正确分类预测分离。
- 该方法使用一个轻量级的两层神经网络,以目标DNN的logit输出作为输入,并将其映射为19类的softmax输出(18个原始类别 + 1个误分类类别)。
- 简化变体CCAC-S通过使用单个温度缩放参数处理正确类别logits,并采用小型神经网络处理误分类类别,从而减少参数数量。
- 校准模型通过一个混合损失函数进行训练,其中超参数λ₁和λ₂用于在验证集上平衡交叉熵损失与校准目标。
- 通过在新数据集的少量已标注OOD样本上微调CCAC-S,实现模型的可迁移性,从而在无需重新训练完整模型的情况下实现适应。
- 置信度校准通过标准指标进行评估:预期校准误差(ECE)、Brier评分(BS)、AUROC、AUPR以及p.9(正确预测的置信度)。
实验结果
研究问题
- RQ1事后校准方法能否有效降低深度神经网络分类器在分布外测试数据上的过度自信问题?
- RQ2引入一个用于表示误分类样本的辅助类,是否能提升OOD数据上预测置信度的可靠性?
- RQ3简化校准模型(CCAC-S)是否能在减少自由参数数量的同时保持强大性能,从而提升泛化能力与可迁移性?
- RQ4CCAC方法在仅使用少量标注数据的情况下,能否高效迁移至新的、未见过的OOD数据集?
- RQ5CCAC在多样化OOD数据集上是否能持续优于现有事后校准方法,在ECE和Brier评分方面表现更优?
主要发现
- 在20 Newsgroups OOD数据集上,CCAC将预期校准误差(ECE)降低至3.9%,显著优于次优基线方法(Dirichlet方法,8.6%)。
- CCAC-S在OOD数据集上实现了3.0%的ECE,表明参数更少的简化模型仍可达到最先进水平的校准性能。
- 在OOD数据集上,CCAC将AUROC提升至0.861,AUPR提升至0.894,优于所有基线方法,包括温度缩放(AUROC: 0.855,AUPR: 0.917)。
- 通过仅使用320个标注样本进行微调,迁移模型CCAC-T在OOD数据集上实现了4.7%的ECE,表明其具备极强的可迁移性,且所需数据极少。
- 可靠性图与置信度直方图显示,CCAC生成了校准良好的置信度分数:正确预测集中于高置信度区域,而误分类样本则被清晰分离并分配较低置信度。
- 在D1数据集(分布内)上,CCAC实现了2.4%的ECE与0.125的Brier评分,表明其在分布内数据上也表现出色,且在所有基线方法上均保持一致改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。