Skip to main content
QUICK REVIEW

[论文解读] On Calibration and Out-of-domain Generalization

Yoav Wald, Amir Feder|arXiv (Cornell University)|Feb 20, 2021
Domain Adaptation and Few-Shot Learning参考文献 41被引用 10
一句话总结

本文提出多领域校准作为机器学习中分布外(OOD)泛化的一种实用且理论基础坚实的替代方法。通过证明在多个领域中同时进行校准可消除虚假相关性,作者提出了若干方法——基于多领域ECE的模型选择、鲁棒等倾回归以及端到端校准训练——在WILDS和带颜色MNIST基准测试中显著提升了OOD性能。

ABSTRACT

Out-of-domain (OOD) generalization is a significant challenge for machine learning models. Many techniques have been proposed to overcome this challenge, often focused on learning models with certain invariance properties. In this work, we draw a link between OOD performance and model calibration, arguing that calibration across multiple domains can be viewed as a special case of an invariant representation leading to better OOD generalization. Specifically, we show that under certain conditions, models which achieve \emph{multi-domain calibration} are provably free of spurious correlations. This leads us to propose multi-domain calibration as a measurable and trainable surrogate for the OOD performance of a classifier. We therefore introduce methods that are easy to apply and allow practitioners to improve multi-domain calibration by training or modifying an existing model, leading to better performance on unseen domains. Using four datasets from the recently proposed WILDS OOD benchmark, as well as the Colored MNIST dataset, we demonstrate that training or tuning models so they are calibrated across multiple domains leads to significantly improved performance on unseen test domains. We believe this intriguing connection between calibration and OOD generalization is promising from both a practical and theoretical point of view.

研究动机与目标

  • 解决机器学习中分布外(OOD)泛化的问题,即模型在未见分布上表现不佳,尽管其在域内表现良好。
  • 识别现有不变表示学习方法中的关键缺陷,即难以扩展到高维数据,且常无法消除虚假相关性。
  • 建立多领域模型校准与虚假相关性缺失之间的理论联系,将校准作为不变性的代理。
  • 开发实用、可训练且可度量的方法以提升多领域校准,从而在现实场景中实现更好的OOD泛化。
  • 通过实证结果证明,优化多领域校准可显著提升多种基准测试(包括WILDS和带颜色MNIST)中的OOD准确率。

提出的方法

  • 提出多领域期望校准误差(ECE)得分,作为衡量多个环境校准程度的指标,定义为所有训练领域ECE的平均值。
  • 提出基于最小化多领域ECE的模型选择方法,同时将域内准确率约束在目标阈值,实现准确率与鲁棒性之间的权衡。
  • 应用鲁棒等倾回归作为后处理步骤,对模型在各领域进行重新校准,提升校准效果而无需重新训练。
  • 制定端到端训练目标,直接利用Kumar等人(2018)的方法优化多领域校准,使深度网络能够学习到校准且不变的表示。
  • 使用因果建模区分因果特征、非虚假反因果特征和虚假反因果特征,将理论分析建立在结构因果模型基础上。
  • 理论分析证明,在一般位置条件下的高斯-线性模型中,多领域校准可推出虚假相关性的缺失,为该方法提供了形式化依据。

实验结果

研究问题

  • RQ1多领域校准能否作为可度量且可训练的OOD泛化替代方法?
  • RQ2在何种条件下,多领域校准可推出模型中虚假相关性的缺失?
  • RQ3与基于不变性的现有方法(如不变风险最小化,IRM)相比,多领域校准在OOD性能方面表现如何?
  • RQ4后处理技术(如等倾回归)在提升校准能力方面,能在多大程度上改善OOD泛化?
  • RQ5优化多领域校准是否能在多种基准数据集上持续提升OOD准确率?

主要发现

  • 在一般位置条件下,高斯-线性模型中,若在足够多的领域中实现同时校准,则可严格证明虚假相关性被消除。
  • 基于最小化多领域ECE的模型选择方法,在测试环境(分布为0.25,0.9)下实现了64.98%的OOD准确率,优于仅基于域内准确率选择的模型。
  • 在IRMv1失败的场景中,所提方法在性能上显著优于IRMv1,例如当IRMv1惩罚项无法按OOD准确率对模型进行排序时。
  • 鲁棒等倾回归后处理可提升各领域校准效果,并在不重新训练的情况下增强OOD泛化能力。
  • 在WILDS基准测试中,使用多领域校准目标训练深度网络可显著提升OOD准确率,尤其在CivilComments和CAMELYON17数据集上表现突出。
  • 训练环境的平均ECE与OOD性能的相关性比IRMv1惩罚项更可靠,尤其在IRM方法失效的复杂分布偏移场景中。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。