[论文解读] Calibrated neighborhood aware confidence measure for deep metric learning
该论文提出NED(距离的归一化指数),一种用于深度度量学习的校准且可解释的置信度度量方法,通过在嵌入空间中使用高斯核平滑来近似类别的数据分布。该方法在极少超参数调优的情况下,显著提升了在干净数据、损坏数据和对抗性测试数据上的鲁棒性和泛化能力,在四个基准数据集上持续优于基线模型。
Deep metric learning has gained promising improvement in recent years following the success of deep learning. It has been successfully applied to problems in few-shot learning, image retrieval, and open-set classifications. However, measuring the confidence of a deep metric learning model and identifying unreliable predictions is still an open challenge. This paper focuses on defining a calibrated and interpretable confidence metric that closely reflects its classification accuracy. While performing similarity comparison directly in the latent space using the learned distance metric, our approach approximates the distribution of data points for each class using a Gaussian kernel smoothing function. The post-processing calibration algorithm with proposed confidence metric on the held-out validation dataset improves generalization and robustness of state-of-the-art deep metric learning models while provides an interpretable estimation of the confidence. Extensive tests on four popular benchmark datasets (Caltech-UCSD Birds, Stanford Online Product, Stanford Car-196, and In-shop Clothes Retrieval) show consistent improvements even at the presence of distribution shifts in test data related to additional noise or adversarial examples.
研究动机与目标
- 解决深度度量学习模型中缺乏可靠且可解释的置信度估计问题。
- 提升模型在分布偏移(如图像损坏和对抗性攻击)下的鲁棒性。
- 提供一种无需微调主干网络的后处理校准方法,具有良好的泛化能力。
- 实现与预测准确率强相关联的精确置信度估计。
- 降低k-NN方法中常见的超参数敏感性。
提出的方法
- NED通过计算嵌入空间中k个最近邻距离的指数之和并进行归一化来获得置信度。
- 该方法使用高斯核平滑近似来建模样本属于某一类的条件概率。
- 在保留的验证集上对单一温度参数T进行校准,以改善概率估计,类似于分类任务中的温度缩放。
- 置信度分数基于贝叶斯定理推导,将基于距离的邻域信息与真实正确性概率关联起来。
- 该方法作为后处理应用于预训练的深度度量学习模型,无需架构修改或重新训练。
- 该方法在核密度估计和统计学习理论方面具有理论基础,确保了泛化保证。
实验结果
研究问题
- RQ1能否为深度度量学习开发一种后处理置信度度量,使其与预测准确率高度相关?
- RQ2如何使置信度估计对分布偏移(如图像损坏和对抗性样本)具有鲁棒性?
- RQ3基于邻域感知的置信度度量是否在校准性和准确性方面优于标准k-NN和加权k-NN基线?
- RQ4所提出的NED方法在多大程度上降低了对超参数(如k)选择的敏感性?
- RQ5单一校准温度参数T是否能改善在多样化测试分布上的置信度校准?
主要发现
- 在CUB-200数据集上,NED在损坏测试图像上的平均准确率达到64.8%,比1NN高12%,比kNN高4.3%。
- 在CARS196数据集上,NED在损坏数据上的准确率达到77.2%,ECE仅为2.3%,显著优于kNN(准确率76.0%,ECE 14.1%)。
- 在PGD攻击(ε=0.3)的对抗性样本上,NED保持78.0%的准确率和2.9%的ECE,优于1NN(准确率74.4%,ECE 10.9%)。
- NED在四个基准数据集(CUB-200、CARS196、SOP和In-shop)上均表现出一致的性能提升,ECE更低且准确率高于所有基线方法。
- 该方法对k的选择具有鲁棒性,在k>10后准确率下降极小,表明对超参数调优的敏感性极低。
- 校准后的温度参数T通过更精确地逼近真实数据分布,显著改善了概率估计,该结论通过理论和实证分析得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。