Skip to main content
QUICK REVIEW

[论文解读] Distribution-free calibration guarantees for histogram binning without sample splitting

Chirag Gupta, Aaditya Ramdas|arXiv (Cornell University)|May 10, 2021
Neural Networks and Applications参考文献 26被引用 4
一句话总结

本文首次在不进行样本划分的前提下,基于顺序统计量的马尔可夫性质,为直方图分箱(均匀质量分箱)建立了首个无需分布假设的校准保证。研究证明,对数据进行双重使用(即同一数据既用于分箱又用于概率估计)可获得强有力的理论校准边界,并引入了有效性图作为评估校准性能的新工具,其表现优于标准的ECE指标。

ABSTRACT

We prove calibration guarantees for the popular histogram binning (also called uniform-mass binning) method of Zadrozny and Elkan [2001]. Histogram binning has displayed strong practical performance, but theoretical guarantees have only been shown for sample split versions that avoid 'double dipping' the data. We demonstrate that the statistical cost of sample splitting is practically significant on a credit default dataset. We then prove calibration guarantees for the original method that double dips the data, using a certain Markov property of order statistics. Based on our results, we make practical recommendations for choosing the number of bins in histogram binning. In our illustrative simulations, we propose a new tool for assessing calibration -- validity plots -- which provide more information than an ECE estimate. Code for this work will be made publicly available at https://github.com/aigen/df-posthoc-calibration.

研究动机与目标

  • 通过证明无需样本划分的无分布假设校准边界,填补直方图分箱在理论校准保证方面的空白。
  • 证明样本划分的统计代价在低数据场景下具有实际重要性。
  • 提出有效性图作为ECE等标准指标的更优替代方案,用于评估校准性能。
  • 基于理论与实证结果,为直方图分箱中分箱数量的选择提供实用建议。

提出的方法

  • 利用顺序统计量的马尔可夫性质,推导出无需样本划分的均匀质量分箱(UMD)的无分布假设校准保证。
  • 提出有效性图,用于估计所有预测分箱中校准误差被ε限制的概率,实现条件校准评估。
  • 采用UMD的随机化版本,确保预测得分的绝对连续性,从而提升理论上的边际校准保证。
  • 构建新颖的理论框架,无需数据划分即可界定期望校准误差,依赖顺序统计量与集中不等式。
  • 在UCI信用违约数据集上,使用有效性图对比UMD与UMS(样本划分版本)、固定宽度分箱、等渗回归及缩放-分箱方法。
  • 通过模拟验证理论边界,结果表明理论曲线与实际性能高度吻合,即使因估计误差导致边界轻微低估。

实验结果

研究问题

  • RQ1当同一数据既用于分箱又用于概率估计(即不进行样本划分)时,能否为直方图分箱建立无分布假设的校准保证?
  • RQ2在校准性和统计效率方面,双重使用数据的直方图分箱(UMD)与样本划分版本(UMS)相比表现如何?
  • RQ3有效性图能否提供比标准指标(如ECE)更丰富的校准性能评估信息?
  • RQ4UMD中分箱数量与校准误差之间的理论关系是什么?该关系如何指导实际应用?
  • RQ5UMD的理论校准边界是否与真实世界数据集中的实际性能高度一致?

主要发现

  • 本文首次基于顺序统计量的马尔可夫性质,证明了无需样本划分的均匀质量分箱的无分布假设校准保证。
  • 有效性图显示,UMD在条件校准方面始终优于UMS及其他基线方法(如等渗回归与固定宽度分箱)。
  • 当n=7K时,UMD在ε ≤ 0.05时优于缩放-分箱方法,且理论边界与实际性能高度一致,仅因估计误差导致轻微低估。
  • UMD的理论曲线在n=7K时与实际有效性图相交,表明边界极为紧密,5K个测试样本不足以完全验证该边界。
  • 结果表明,样本划分的统计代价不可忽视,尤其在低数据场景下,双重使用数据在理论上是可接受的。
  • 所提出的有效性图相比ECE提供了更丰富、更可靠的校准性能评估,因其能捕捉预测分箱中校准误差的完整分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。