Skip to main content
QUICK REVIEW

[论文解读] Testing whether a Learning Procedure is Calibrated

Jon Cockayne, Matthew M. Graham|ePrints Soton (University of Southampton)|Dec 23, 2020
Gaussian Processes and Bayesian Inference参考文献 55被引用 4
一句话总结

该论文提出了一种通用框架,用于测试学习过程(如贝叶斯或稳健贝叶斯推断)是否校准,即真实参数是否可被视为其输出分布中的合理抽取样本。通过在预测积分变换(PIT)上使用基于模拟的假设检验与柯尔莫哥洛夫-斯米尔诺夫检验,该方法评估强校准和弱校准,表明在模型误设条件下,分数阶后验可改善校准效果。

ABSTRACT

A learning procedure takes as input a dataset and performs inference for the parameters $θ$ of a model that is assumed to have given rise to the dataset. Here we consider learning procedures whose output is a probability distribution, representing uncertainty about $θ$ after seeing the dataset. Bayesian inference is a prime example of such a procedure, but one can also construct other learning procedures that return distributional output. This paper studies conditions for a learning procedure to be considered calibrated, in the sense that the true data-generating parameters are plausible as samples from its distributional output. A learning procedure whose inferences and predictions are systematically over- or under-confident will fail to be calibrated. On the other hand, a learning procedure that is calibrated need not be statistically efficient. A hypothesis-testing framework is developed in order to assess, using simulation, whether a learning procedure is calibrated. Several vignettes are presented to illustrate different aspects of the framework.

研究动机与目标

  • 定义并形式化输出参数概率分布的学习过程的校准概念。
  • 解决目前缺乏适用于任意学习过程(超越贝叶斯推断)的一般性、数学上精确的校准定义的问题。
  • 开发一种实用的、基于模拟的假设检验框架,以评估学习过程是否校准。
  • 区分强校准与弱校准,从而实现严谨评估与更易访问的测试。
  • 在多种学习过程中(包括贝叶斯、变分推断和稳健贝叶斯方法)展示该框架的应用,特别是在模型误设条件下。

提出的方法

  • 在温和正则性条件下,将学习过程形式化为从数据到参数后验分布的可测映射。
  • 将强校准定义为:在后验分布下,真实参数的预测积分变换(PIT)在区间[0,1]上服从均匀分布。
  • 将弱校准定义为:在重复抽样下,PIT分布与均匀分布具有随机等价性。
  • 使用柯尔莫哥洛夫-斯米尔诺夫(KS)检验来评估PIT服从均匀分布的原假设,从而实现校准的统计检验。
  • 在已知数据生成模型(包括似然函数误设)的模拟数据上应用该框架,以测试各种学习过程的校准性。
  • 使用蒙特卡洛采样估计PIT分布并计算用于校准评估的检验统计量。

实验结果

研究问题

  • RQ1对于输出概率分布的学习过程,其一般性、数学上严谨的校准定义应如何构成?
  • RQ2在后验分布难以计算或模型误设的情况下,如何在实践中测试学习过程是否校准?
  • RQ3与标准贝叶斯推断相比,替代学习过程(如分数阶后验或变分贝叶斯)在多大程度上改善了校准效果?
  • RQ4所提出的框架能否在模型误设条件下检测到学习过程的过度自信或校准偏差?
  • RQ5强校准与弱校准在实际影响和可测试性方面有何不同?

主要发现

  • 在似然函数误设条件下,使用指数 $ t = 0.1, 0.2, 0.3 $ 的分数阶后验方法相比标准贝叶斯推断表现出更优的校准效果,表现为PIT分布更均匀。
  • 在误设条件下,对标准贝叶斯推断的PIT进行KS检验,成功拒绝了强校准的原假设,表明其存在校准偏差。
  • 对于分数阶后验,PIT分布更趋均匀,KS检验的p值更高,表明其校准效果更优,尤其在 $ t = 0.1 $ 时表现更佳。
  • 该框架通过PIT偏离均匀性的显著偏差,检测到标准贝叶斯推断的过度自信,即使后验预测检查结果看似可接受。
  • 弱校准比强校准更容易测试,该框架为在无需精确后验计算的情况下评估校准性提供了实用路径。
  • 结果表明,校准是一个独立且关键的期望属性,应与统计效率或预测性能分开评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。