Skip to main content
QUICK REVIEW

[论文解读] CRUDE: Calibrating Regression Uncertainty Distributions Empirically

Eric Zelikman, Christopher Healy|arXiv (Cornell University)|May 26, 2020
Fault Detection and Control Systems参考文献 46被引用 14
一句话总结

CRUDE 是一种用于回归不确定性后处理校准的方法,通过从保留校准集 empirically 学习预测误差分布的形状,而无需假设特定的参数形式。它在多种回归任务中同时提升了校准性和精确性,优于当前最先进的方法(包括高斯最大似然估计和 Kuleshov 等人)在 UCI 数据集和目标检测基准上的表现。

ABSTRACT

Calibrated uncertainty estimates in machine learning are crucial to many fields such as autonomous vehicles, medicine, and weather and climate forecasting. While there is extensive literature on uncertainty calibration for classification, the classification findings do not always translate to regression. As a result, modern models for predicting uncertainty in regression settings typically produce uncalibrated and overconfident estimates. To address these gaps, we present a calibration method for regression settings that does not assume a particular uncertainty distribution over the error: Calibrating Regression Uncertainty Distributions Empirically (CRUDE). CRUDE makes the weaker assumption that error distributions have a constant arbitrary shape across the output space, shifted by predicted mean and scaled by predicted standard deviation. We detail a theoretical connection between CRUDE and conformal inference. Across an extensive set of regression tasks, CRUDE demonstrates consistently sharper, better calibrated, and more accurate uncertainty estimates than state-of-the-art techniques.

研究动机与目标

  • 解决回归模型中缺乏有效不确定性校准的问题,这些模型通常产生过度自信且未校准的预测结果。
  • 克服现有校准方法的局限性,这些方法假设特定的误差分布形式(例如高斯分布)或依赖可逆的校准曲线。
  • 开发一种方法,在不依赖辅助模型或强分布假设的前提下,同时改善校准性和精确性——这两项目标在不确定性估计中通常相互冲突。
  • 在多种回归任务(包括表格数据和目标检测)中展示 CRUDE 的有效性,这些任务中不确定性校准至关重要。
  • 建立 CRUDE 与分位数推断之间的理论联系,将经验校准与统计学中一个成熟框架联系起来。

提出的方法

  • CRUDE 使用保留校准集来 empirically 估计数据集中预测误差(y_true - y_pred)的分布。
  • 它假设误差分布在整个输入空间中具有固定且任意的形状,但其位置由预测均值偏移、尺度由预测标准差缩放。
  • 对于每个新预测,CRUDE 通过将经验误差的累积分布函数(CDF)应用于标准化误差(y_true - y_pred)/ predicted_std,构建校准后的不确定性分布。
  • 该方法通过直接使用误差的 empirically 累积分布函数(ECDF)避免了参数假设,从而能够适应偏态或重尾的误差分布。
  • CRUDE 是一种后处理方法,可应用于任何输出均值和方差预测的预训练回归模型。
  • 该方法在特定条件下与分位数推断在数学上等价,将经验校准与一个理论基础坚实的框架联系起来。

实验结果

研究问题

  • RQ1是否存在一种校准方法,能够在不假设误差分布特定参数形式的前提下,同时提升回归任务中的校准性和精确性?
  • RQ2在多种回归数据集上,CRUDE 与高斯最大似然估计和 Kuleshov 等人方法相比,在校准性和精确性方面表现如何?
  • RQ3在真实世界应用(如使用预训练模型的目标检测)中,CRUDE 在多大程度上改善了不确定性校准?
  • RQ4CRUDE 与分位数推断之间存在何种理论关系?该联系如何增强方法的可解释性和可靠性?
  • RQ5当误差分布非平稳或校准数据有限时,CRUDE 对其假设的违反有多敏感?

主要发现

  • 在 UCI 基准数据集上,CRUDE 在多个模型和数据集上始终优于 Kuleshov 等人和高斯最大似然估计,在校准性和精确性方面均表现更优。
  • 在 COCO 目标检测任务中,CRUDE 相较于未校准模型将校准均方根误差(RMSE)降低了 90%,相较于 Kuleshov 等人方法在表现最佳的 DETR 模型上降低了 72%。
  • 在 COCO 上测试的九组模型组合中,CRUDE 在除一组外的所有组合中均优于 Kuleshov 等人方法,在校准性和精确性方面表现更优。
  • 该方法在采用不同不确定性估计策略(包括蒙特卡洛丢弃和 NGBoost)的模型上均表现出稳健性。
  • 经验误差分布常表现出偏度和峰度,解释了为何像高斯最大似然估计这样的参数方法在实践中表现不佳。
  • 建立了 CRUDE 与分位数推断之间的理论等价性,表明 CRUDE 的校准在相同的频率覆盖保证下是有效的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。