Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Calibration under Covariate Shift

Anusri Pampari, Stefano Ermon|arXiv (Cornell University)|Jun 29, 2020
Anomaly Detection Techniques and Applications参考文献 26被引用 4
一句话总结

本文提出了一种基于重要性采样(importance sampling)的方法,用于在协变量偏移(covariate shift)条件下校准机器学习模型,即测试数据分布与训练数据分布不同时。通过利用领域不变特征并借助判别器估计密度比,该方法可在无需目标数据标签的情况下,适配任意现有校准技术(如温度缩放),显著降低校准误差(例如,ECE 从 20.6% 降低至 7.7%),即使模型通过领域自适应训练,依然表现优异。

ABSTRACT

A probabilistic model is said to be calibrated if its predicted probabilities match the corresponding empirical frequencies. Calibration is important for uncertainty quantification and decision making in safety-critical applications. While calibration of classifiers has been widely studied, we find that calibration is brittle and can be easily lost under minimal covariate shifts. Existing techniques, including domain adaptation ones, primarily focus on prediction accuracy and do not guarantee calibration neither in theory nor in practice. In this work, we formally introduce the problem of calibration under domain shift, and propose an importance sampling based approach to address it. We evaluate and discuss the efficacy of our method on both real-world datasets and synthetic datasets.

研究动机与目标

  • 识别出尽管准确率高,经过领域自适应的模型在协变量偏移下仍存在校准偏差。
  • 解决当测试数据分布偏离训练数据时,模型缺乏校准的问题。
  • 开发一种在无需标签目标数据的前提下,实现领域偏移下模型校准的方法。
  • 提升安全关键应用中的不确定性量化能力,使模型置信度真实反映预测可靠性。

提出的方法

  • 使用重要性采样,基于源域与目标域分布之间的估计密度比,重新加权源域验证数据。
  • 采用领域对抗网络(如 CDAN)中的领域不变特征层,训练一个二分类判别器以估计密度比。
  • 将估计的密度比应用于修改校准目标函数,使任意现有校准方法(如温度缩放)能够适配至目标域。
  • 利用判别器的输出近似似然比 p_target(x)/p_source(x),该比值用作校准损失中的重要性权重。
  • 将加权校准目标函数整合至标准事后校准技术中,使其在分布偏移下仍具泛化能力。
  • 采用真实世界数据集(Office-31、Office-Home、MNIST-USPS)在多种领域偏移场景下评估该方法。

实验结果

研究问题

  • RQ1现有校准技术(如温度缩放)在协变量偏移下是否仍能保持良好的校准性能?
  • RQ2即使准确率得以保持,领域自适应在多大程度上会损害模型的校准性?
  • RQ3能否在无标签目标数据的条件下,实现协变量偏移下的无监督校准?
  • RQ4使用估计密度比的重要性采样在提升领域偏移下的校准性能方面有多有效?
  • RQ5在真实场景中,哪些因素限制了所提方法的性能?

主要发现

  • 所提出的加权校准方法在领域偏移数据上显著降低了期望校准误差(ECE),在 Office-31 的 A→D 设置中,ECE 从 14.7% 降低至 6.0%。
  • 在 MNIST-USPS 数据集中,M→U 转移任务中,ECE 从 20.6% 降低至 7.7%,表明该方法在分布偏移下具有强大性能。
  • 在 Office-Home 数据集中,Cl→Pr 转移任务的 ECE 从 13.3% 降至 6.4%,表明在多样化领域间具有持续改进效果。
  • 该方法优于未加权校准和基线方法,尤其在源域与目标域分布差异显著时表现更优。
  • 在某些设置中(如 A→W、A→D)性能下降,与数据不平衡及密度比估计不佳有关,凸显了主要限制。
  • 该方法的有效性高度依赖于密度比估计的准确性,表明未来工作应重点关注提升该步骤。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。