Skip to main content
QUICK REVIEW

[论文解读] Improving Confidence Estimates for Unfamiliar Examples

Zhizhong Li, Derek Hoiem|arXiv (Cornell University)|Apr 9, 2018
Adversarial Robustness in Machine Learning参考文献 50被引用 4
一句话总结

本文通过评估校准技术、集成方法、蒸馏和贝叶斯方法,解决深度学习模型在分类不熟悉但有效样本时出现的过度自信预测问题。温度缩放模型的集成方法在熟悉和不熟悉的数据分布上,显著降低了标签错误、校准错误和似然误差,表现最佳。

ABSTRACT

Intuitively, unfamiliarity should lead to lack of confidence. In reality, current algorithms often make highly confident yet wrong predictions when faced with relevant but unfamiliar examples. A classifier we trained to recognize gender is 12 times more likely to be wrong with a 99% confident prediction if presented with a subject from a different age group than those seen during training. In this paper, we compare and evaluate several methods to improve confidence estimates for unfamiliar and familiar samples. We propose a testing methodology of splitting unfamiliar and familiar samples by attribute (age, breed, subcategory) or sampling (similar datasets collected by different people at different times). We evaluate methods including confidence calibration, ensembles, distillation, and a Bayesian model and use several metrics to analyze label, likelihood, and calibration error. While all methods reduce over-confident errors, the ensemble of calibrated models performs best overall, and T-scaling performs best among the approaches with fastest inference. Our code is available at https://github.com/lizhitwo/ConfidenceEstimates . $\color{red}{ ext{Please see UPDATED ERRATA.}}$

研究动机与目标

  • 研究并解决深度神经网络在测试时对不熟悉但语义有效的样本做出高度自信却错误预测的问题。
  • 开发并评估一种系统性方法,基于属性(如年龄、品种)或采样差异(如不同数据采集时间)将测试数据划分为熟悉和不熟悉子集。
  • 比较置信度校准、集成方法、蒸馏和贝叶斯不确定性估计在提升分布外但有效输入预测置信度可靠性方面的有效性。
  • 证明在独立同分布(i.i.d.)验证集上进行的标准校准会导致在不熟悉数据上出现过度自信,因此需要专门的评估和调优策略。

提出的方法

  • 提出一种新颖的评估框架,通过基于属性(如年龄、品种)或基于采样(如不同数据采集时段)的方式,将测试数据划分为熟悉和不熟悉子集。
  • 应用温度缩放(T-scaling)进行置信度校准,在验证集上优化温度参数,以提升校准和似然得分。
  • 采用T缩放分类器的模型集成,以改善不确定性估计并减少过度自信,利用模型间预测的方差。
  • 引入知识蒸馏和生成式蒸馏(G-distillation),将集成模型的性能迁移至单个模型,旨在保持低推理成本的同时保留准确性和校准性。
  • 通过蒙特卡洛 dropout(MC-Dropout)实现贝叶斯深度学习,以估计预测不确定性,并与其他方法进行比较。
  • 采用标准指标,包括标签错误、期望校准误差(ECE)、负对数似然(NLL)和 Brier 评分,评估模型在熟悉和不熟悉数据上的性能。

实验结果

研究问题

  • RQ1当在训练期间未见过的但有效的样本上测试时,深度神经网络在置信度校准和预测准确性方面表现如何?
  • RQ2与基线模型相比,置信度校准(如 T-scaling)在多大程度上能减少不熟悉数据上的过度自信错误?
  • RQ3集成方法、蒸馏和贝叶斯模型在改善不熟悉样本置信度估计方面表现如何比较?
  • RQ4在 i.i.d. 验证集上校准是否会导致对不熟悉数据的置信度过高?这种问题能否通过使用不同采样方式的验证集来缓解?
  • RQ5知识蒸馏能否有效将集成模型的鲁棒性迁移至单个模型,同时在不熟悉数据上保持低校准误差和标签错误?

主要发现

  • 不熟悉样本的校准误差和标签错误显著高于熟悉样本,模型在未见年龄组上做出错误的 99% 置信预测的可能性高出 12 倍。
  • 温度缩放模型的集成在所有数据集和划分中均达到最低的标签错误、校准误差、NLL 和 Brier 评分,优于所有其他方法。
  • 仅使用 T-scaling 即可降低熟悉和不熟悉数据上的似然误差和校准误差,且在单模型方法中表现最佳,推理成本最低。
  • 蒸馏和 G-蒸馏并未持续优于 T-scaling,尽管训练复杂度增加,但性能提升不显著。
  • 贝叶斯方法(Kendall 等人)整体表现第二,标签错误仅略高于集成方法,且校准改进效果相当。
  • 在 i.i.d. 验证集上进行校准会导致对不熟悉样本的置信度被高估,表明为实现最优校准,需要使用存在分布偏移的验证集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。