Skip to main content
QUICK REVIEW

[论文解读] On the Expected Size of Conformal Prediction Sets

Guneet S. Dhillon, George Deligiannidis|arXiv (Cornell University)|Jun 12, 2023
Statistical Methods and Inference被引用 4
一句话总结

本文提供了对分割交叉验证中预测集合期望大小的首个有限样本理论分析,基于单次数据划分,推导出可计算的点估计和高概率置信区间。该方法实现了无需重复蒙特卡洛采样的高效、一次性期望集合大小估计,已在回归和分类任务中通过实证验证,具备强覆盖保证。

ABSTRACT

While conformal predictors reap the benefits of rigorous statistical guarantees on their error frequency, the size of their corresponding prediction sets is critical to their practical utility. Unfortunately, there is currently a lack of finite-sample analysis and guarantees for their prediction set sizes. To address this shortfall, we theoretically quantify the expected size of the prediction sets under the split conformal prediction framework. As this precise formulation cannot usually be calculated directly, we further derive point estimates and high-probability interval bounds that can be empirically computed, providing a practical method for characterizing the expected set size. We corroborate the efficacy of our results with experiments on real-world datasets for both regression and classification problems.

研究动机与目标

  • 为解决当前缺乏对自适应预测集合期望大小的有限样本分析这一关键问题,该问题对实际部署至关重要。
  • 在分割交叉验证框架下,提供理论上合理且可实证计算的期望预测集合大小估计。
  • 为不同误差容忍度和数据约束条件下的多样化用户提供高效的一次运行期望集合大小估计。
  • 提供适应非一致性函数的高概率区间估计,适用于分类与回归任务。
  • 通过理论近似替代蒙特卡洛平均,降低经验估计的计算负担,将重复计算替换为一次性的理论计算。

提出的方法

  • 基于校准数据上非一致性得分的分布,推导出在独立同分布数据下分割交叉验证预测集合期望大小的理论表达式。
  • 提出一种利用经验校准得分的期望集合大小点估计,避免重复模型运行。
  • 应用中心极限定理与Dvoretzky–Kiefer–Wolfowitz不等式,构建围绕期望集合大小的高概率置信区间。
  • 引入对非一致性函数自适应的区间估计方法,适用于分类与回归问题。
  • 通过合成数据集与真实世界数据集对估计结果进行实证验证,将点估计与区间估计与蒙特卡洛平均进行对比。
  • 所有估计均基于单次数据划分,无需为每种用户配置重复运行交叉验证。

实验结果

研究问题

  • RQ1在分割交叉验证预测框架中,预测集合的有限样本期望大小是多少?
  • RQ2我们能否在不重复蒙特卡洛采样的前提下,推导出可计算的期望预测集合大小点估计?
  • RQ3如何构建适用于不同非一致性函数的高概率置信区间,以保证期望集合大小估计的可靠性?
  • RQ4与蒙特卡洛平均相比,所提出的估计在准确性和覆盖性方面表现如何?
  • RQ5该方法是否能统一适用于分类与回归任务,且在不同数据规模与误差容忍度约束下保持有效性?

主要发现

  • 定理1推导出的理论期望预测集合大小,被验证为当校准样本点数量增加时,蒙特卡洛平均的极限值。
  • 所提出的点估计能紧密跟踪理论期望大小,并随着校准数据量的增加而收敛。
  • 通过中心极限定理与Dvoretzky–Kiefer–Wolfowitz不等式构建的置信区间具有高覆盖性,在γ=0.1和γ=0.01时,错误频率分别低于名义水平的99.9%与100%的案例中成立。
  • 所提出的区间估计对非一致性函数具有自适应性,适用于回归任务,而其他方法如HI区间仅限于分类任务。
  • 该方法显著减少了重复交叉验证运行的需求,使得单次数据收集与计算即可服务于具有不同误差容忍度水平的多个用户。
  • 在合成数据集与真实世界数据集上的实证结果表明,点估计与区间边界在$a$、$b$、$m$与$n$等不同设置下均保持准确可靠。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。