Skip to main content
QUICK REVIEW

[论文解读] Class-Similarity Based Label Smoothing for Generalized Confidence Calibration.

Chihuang Liu, Joseph F. JáJá|arXiv (Cornell University)|Jun 24, 2020
Adversarial Robustness in Machine Learning参考文献 40被引用 5
一句话总结

本文提出基于类别相似性的标签平滑方法,通过利用类别之间的语义和结构相似性,提升神经网络的置信度校准性能。通过用相似性驱动的标签分布替代均匀标签平滑,该方法在复杂类别关系场景下,相较于现有方法展现出更优的校准效果。

ABSTRACT

Since modern neural networks are known to be overconfident, several techniques have been recently introduced to address this problem and improve calibration. However, the current notion of calibration is overly simple since only single prediction confidence is considered while the information regarding the rest of the classes is ignored. The output of a neural network is a probability distribution where the scores are estimated confidences of the input belonging to the corresponding classes, and hence they represent a complete estimate of the output likelihood that should be calibrated. In this paper, we first introduce a generalized definition of confidence calibration, which motivates the development of a novel form of label smoothing where the value of each class label is based on its similarity with the reference class. We adopt different similarity measurements, including those that capture semantic similarity, and demonstrate through extensive experiments the advantage of our method over both uniform label smoothing and other techniques.

研究动机与目标

  • 为解决现代神经网络中因概率输出校准不足而导致的过度自信问题。
  • 克服传统校准方法仅关注预测类别置信度的局限,忽略完整概率分布的问题。
  • 开发一种通用的置信度校准框架,通过相似性度量整合类别间关系。
  • 通过用反映语义或结构类别关系的相似性感知标签平滑替代均匀标签平滑,提升模型校准性能。
  • 通过实证验证所提方法在均匀标签平滑及其他最先进校准技术中的优越性。

提出的方法

  • 提出一种广义的置信度校准定义,考虑整个输出概率分布,而不仅限于预测类别。
  • 引入一种新颖的标签平滑技术,其中每个类别的标签值由其与参考类别的相似性决定,采用如语义嵌入或结构特征等度量方法。
  • 使用多种相似性度量方法——包括词嵌入或学习表征上的余弦相似度——计算类别特定的平滑值。
  • 在训练过程中调整软标签,使与真实类别相似的类别获得更高的平滑权重,从而生成更真实的概率分布。
  • 使用基于这些相似性标签的交叉熵损失训练神经网络,以提升校准性能,且无需修改推理过程。
  • 在多个数据集和模型架构上应用该方法,以评估其鲁棒性与泛化能力。

实验结果

研究问题

  • RQ1将类别相似性引入标签平滑后,与均匀标签平滑相比,对模型校准性能有何影响?
  • RQ2是否一种考虑完整概率分布的广义校准定义能带来更优的模型置信度估计?
  • RQ3在细粒度或语义相关分类任务中,使用类别间语义相似性是否能提升校准性能?
  • RQ4与现有校准技术相比,所提方法在预测概率的准确性和可靠性方面表现如何?
  • RQ5不同相似性度量方法(如语义相似性与结构相似性)在多大程度上影响深度神经网络的校准性能?

主要发现

  • 所提出的基于类别相似性的标签平滑方法在多个基准数据集上显著优于均匀标签平滑的校准性能。
  • 采用相似性感知平滑训练的模型相比标准标签平滑或无平滑的模型,表现出更低的期望校准误差(ECE)。
  • 该方法在不损失准确率的前提下实现更优的校准性能,展现出准确率与置信度校准之间的有利权衡。
  • 语义相似性度量(如基于预训练词嵌入的方法)能实现更有效的平滑并提升校准性能,尤其在细粒度分类任务中表现更优。
  • 广义校准框架能有效捕捉类别间关系,从而生成更可靠且校准良好的概率输出。
  • 该方法在不同架构和数据集上均表现出良好的泛化能力,校准指标持续提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。