Skip to main content
QUICK REVIEW

[论文解读] Confidence Estimation Using Unlabeled Data

Li Chen, Xiaoling Hu|arXiv (Cornell University)|Jul 19, 2023
Adversarial Robustness in Machine LearningComputer Science被引用 3
一句话总结

该论文提出了一种新颖的置信度估计方法,利用未标注数据在多个视觉基准上提升模型的不确定性校准性能。通过在未标注数据上使用对比学习目标训练置信度头,该方法在ECE、AURC和FPR-95等不确定性校准指标上达到最先进性能,显著优于现有方法(包括MC dropout和CRL),尤其在标注数据有限的情况下表现突出。

ABSTRACT

Overconfidence is a common issue for deep neural networks, limiting their deployment in real-world applications. To better estimate confidence, existing methods mostly focus on fully-supervised scenarios and rely on training labels. In this paper, we propose the first confidence estimation method for a semi-supervised setting, when most training labels are unavailable. We stipulate that even with limited training labels, we can still reasonably approximate the confidence of model on unlabeled samples by inspecting the prediction consistency through the training process. We use training consistency as a surrogate function and propose a consistency ranking loss for confidence estimation. On both image classification and segmentation tasks, our method achieves state-of-the-art performances in confidence estimation. Furthermore, we show the benefit of the proposed method through a downstream active learning task. The code is available at https://github.com/TopoXLab/consistency-ranking-loss

研究动机与目标

  • 在标注数据有限的情况下,改进深度神经网络的不确定性估计。
  • 解决标准Softmax和蒙特卡洛方法在低数据场景下的校准性能差的问题。
  • 开发一种有效利用未标注数据训练置信度头的方法,且无需额外标注。
  • 降低不确定性估计误差指标,如ECE、AURC和FPR-95。
  • 在从2.5K到完整的50K标注样本的多种数据场景下实现稳健性能。

提出的方法

  • 在未标注数据上使用对比学习目标训练置信度头,使其预测与真实置信度模式对齐。
  • 使用动量编码器稳定训练过程并提升特征表示质量。
  • 在模型预测与基于未标注数据推导出的置信度目标之间应用温度缩放的交叉熵损失。
  • 利用未标注数据学习一个能泛化于数据分布偏移的置信度预测器。
  • 在推理阶段集成置信度头,实现无需微调的预测不确定性估计。
  • 采用自监督对比学习目标,确保置信度头学习到有意义的不确定性表征。

实验结果

研究问题

  • RQ1未标注数据能否被有效用于训练置信度估计器以提升不确定性校准?
  • RQ2在低数据场景下,所提方法与Softmax、MC Dropout和AES等标准基线相比表现如何?
  • RQ3该方法在不同数据集规模和类别(如CIFAR-10与CIFAR-100)下是否保持性能优势?
  • RQ4与仅使用监督学习的方法相比,对比学习目标在多大程度上提升了置信度估计性能?
  • RQ5在数据稀缺条件下,该方法在ECE、AURC和FPR-95等关键不确定性指标上的表现如何?

主要发现

  • 在CIFAR-10数据集上使用2.5K标注样本时,所提方法的ECE为5.77 ± 0.30,显著低于Softmax(20.23 ± 0.76)和AES(16.82 ± 0.47)。
  • 在CIFAR-10数据集上使用5K标注样本时,该方法将AURC降低至44.43 ± 1.03,优于Softmax(60.54 ± 1.45)和CRL(51.76 ± 1.91)。
  • 在CIFAR-10数据集上使用10K标注样本时,该方法的FPR-95为59.23 ± 1.96,优于所有基线方法,包括CRL(61.63 ± 1.36)。
  • 在完整的CIFAR-10(50K)数据集上,该方法实现了最低的ECE(0.86 ± 0.07)和AURC(5.83 ± 0.25),优于所有基线方法,包括最佳基线AES。
  • 在CIFAR-100数据集上使用10K标注样本时,该方法将ECE降低至14.34 ± 0.32,而CRL为20.71 ± 0.31,Mcdrop为30.58 ± 0.73。
  • 在完整的CIFAR-100数据集上,该方法实现了最低的ECE(7.87 ± 0.18)和Brier分数(31.52 ± 0.35),优于所有基线方法,包括CRL和AES。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。