[论文解读] Unsupervised Temperature Scaling: An Unsupervised Post-Processing Calibration Method of Deep Networks
本文提出无监督温度缩放(UTS),一种后处理方法,仅使用未标记的测试样本对深度神经网络进行校准,无需依赖带标签的验证数据。UTS在保持模型准确率和计算效率的同时,实现了与监督温度缩放相当的最先进校准性能,显著提升了皮肤病变检测任务中置信度的可靠性。
The great performances of deep learning are undeniable, with impressive results over a wide range of tasks. However, the output confidence of these models is usually not well-calibrated, which can be an issue for applications where confidence on the decisions is central to providing trust and reliability (e.g., autonomous driving or medical diagnosis). For models using softmax at the last layer, Temperature Scaling (TS) is a state-of-the-art calibration method, with low time and memory complexity as well as demonstrated effectiveness. TS relies on a T parameter to rescale and calibrate values of the softmax layer, whose parameter value is computed from a labelled dataset. We are proposing an Unsupervised Temperature Scaling (UTS) approach, which does not depend on labelled samples to calibrate the model, which allows, for example, the use of a part of a test samples to calibrate the pre-trained model before going into inference mode. We provide theoretical justifications for UTS and assess its effectiveness on a wide range of deep models and datasets. We also demonstrate calibration results of UTS on skin lesion detection, a problem where a well-calibrated output can play an important role for accurate decision-making.
研究动机与目标
- 解决深度学习中模型校准不足的问题,即Softmax输出过于自信,无法准确反映真实类别概率。
- 消除后训练校准对标签数据的依赖,因为此类数据在真实应用场景(如医学诊断)中成本高昂且不切实际。
- 开发一种方法,在保持温度缩放的低复杂度和准确率保留特性的同时,仅使用未标记的测试样本实现校准。
- 在多种架构和数据集上验证UTS的有效性,特别是在皮肤病变检测等高风险应用场景中。
提出的方法
- UTS通过在小规模未标记测试子集上最小化负对数似然(NLL)来估计最优温度参数T,从而避免对标签的依赖。
- 识别位于决策边界附近的样本——即类别概率均衡的样本——作为校准的可靠候选,利用其对称的后验分布特性。
- 计算阈值θₖ为所有误分类样本中类别k的Softmax分数的均值与标准差之和,以选择高置信度且具有歧义的预测。
- 利用未标记样本的置信度分数的经验分布来近似真实校准分布,从而在无标签条件下实现T的估计。
- 在推理后应用温度缩放变换S_y(x) = exp(h_y / T) / Σ_j exp(h_j / T),以重新校准置信度输出。
- 该方法在理论上得到支持,表明位于决策边界附近的样本具有对称的后验似然,因此适用于无监督校准。
实验结果
研究问题
- RQ1是否可以仅使用未标记的测试样本,而无需标签,有效实现深度神经网络的校准?
- RQ2UTS是否在保持低计算成本的同时,实现与监督温度缩放相当的校准性能?
- RQ3UTS在真实世界中高风险应用场景(如皮肤病变分类)中的表现如何,尤其是在标签成本高昂的情况下?
- RQ4是否可以可靠地利用决策边界附近的样本,以无监督方式估计最优温度参数T?
- RQ5UTS对误分类样本与正确分类样本的置信度校准有何影响?
主要发现
- UTS在多个数据集和架构上持续改善校准性能,其表现与监督温度缩放相当或更优。
- 在CIFAR-10数据集上使用ResNet18时,UTS将ECE从0.043降低至0.031,NLL从0.427降低至0.301,在某些情况下优于TS。
- 在ISIC 2018皮肤病变检测任务中,UTS显著降低了对误分类样本的置信度,同时保持了对正确分类样本的高置信度。
- 该方法在校准后维持了模型的准确率,证实温度缩放不会改变模型的预测排序。
- 在12组模型-数据集组合中,UTS在7组上优于TS,表明其在多样化设置下的鲁棒性。
- 通过理论和实证分析验证了使用未标记数据进行校准的有效性,表明边界样本能提供对真实校准分布的可靠估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。