Skip to main content
QUICK REVIEW

[论文解读] Robust Calibration with Multi-domain Temperature Scaling

Yaodong Yu, Stephen Bates|arXiv (Cornell University)|Jun 6, 2022
Anomaly Detection Techniques and Applications被引用 6
一句话总结

本文提出多领域温度缩放(multi-domain temperature scaling),一种通过学习领域特定的温度参数来提升模型在多样化数据分布下校准性能的方法。通过利用多个领域之间的异质性,该方法在分布内和分布外领域上的校准性能均显著优于标准温度缩放,在三个基准数据集上均得到实证验证。

ABSTRACT

Uncertainty quantification is essential for the reliable deployment of machine learning models to high-stakes application domains. Uncertainty quantification is all the more challenging when training distribution and test distribution are different, even the distribution shifts are mild. Despite the ubiquity of distribution shifts in real-world applications, existing uncertainty quantification approaches mainly study the in-distribution setting where the train and test distributions are the same. In this paper, we develop a systematic calibration model to handle distribution shifts by leveraging data from multiple domains. Our proposed method -- multi-domain temperature scaling -- uses the heterogeneity in the domains to improve calibration robustness under distribution shift. Through experiments on three benchmark data sets, we find our proposed method outperforms existing methods as measured on both in-distribution and out-of-distribution test sets.

研究动机与目标

  • 解决模型在分布偏移下的关键校准挑战,即测试数据分布与训练数据不一致的问题。
  • 认识到现有校准方法(如温度缩放)在应用于单一分布外领域时表现不佳,尽管其在合并数据上表现良好。
  • 开发一种系统性校准框架,确保在所有观测领域中均能获得可靠的不确定性估计,并可泛化至未见领域。
  • 对在具有不同数据分布的多个领域上进行训练的模型,其鲁棒校准是否可能进行理论与实证研究。

提出的方法

  • 提出多领域温度缩放,作为单温度缩放的推广,为每个输入学习一个领域特定的温度参数。
  • 使用神经网络或函数逼近器将输入特征映射到温度值,实现在每个领域上的自适应校准。
  • 使用所有领域的验证数据训练校准头,最小化跨领域的期望校准误差(ECE)。
  • 该方法隐式学习了分布内领域的混合分布,作为估计对分布外领域泛化能力的代理。
  • 基于H-散度和伪维数对方法进行理论分析,表明在分布内领域表现良好可推导出对未见领域的良好泛化。
  • 通过优化领域混合权重α,最小化分布内领域混合分布与分布外领域之间的H-散度,提升鲁棒性。

实验结果

研究问题

  • RQ1我们能否通过利用多领域数据结构来改善分布偏移下的模型校准?
  • RQ2要求在所有观测领域中均实现校准,是否能带来对未见领域的更好泛化?
  • RQ3是否存在理论依据解释为何多领域校准能提升对分布偏移的鲁棒性?
  • RQ4多领域温度缩放在分布内与分布外数据上的校准误差,与标准温度缩放相比如何?
  • RQ5在H-散度框架下,分布内领域的混合是否可作为对分布外领域泛化的代理?

主要发现

  • 在三个基准数据集上,多领域温度缩放在分布内与分布外测试集上均显著优于标准温度缩放。
  • 在ImageNet-C上,与基于合并数据的温度缩放相比,该方法在各个损坏领域上的期望校准误差(ECE)显著更低,后者在单个领域上无法实现有效校准。
  • 即使在未见领域上,该方法仍能保持良好的校准置信度估计,表明其在分布偏移下具有更强的泛化能力。
  • 理论分析表明,若模型在所有分布内领域均校准良好,且混合分布与分布外分布的H-散度接近,则对未见领域的泛化可能性较高。
  • 实证结果证实,当方法被训练为在每个领域上均表现良好而非仅平均表现时,校准鲁棒性显著提升。
  • 所提方法缩小了分布内与分布外校准之间的差距,解决了现有方法的关键局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。