[论文解读] Constructing Confidence Intervals for 'the' Generalization Error -- a Comprehensive Benchmark Study
本文提出了一项全面的基准测试,评估了13种与模型无关的方法在机器学习中构建泛化误差置信区间(CIs)的表现,使用了18个表格数据集,涵盖4种学习算法和8种损失函数。评估指标包括覆盖率频率、区间宽度和运行时间,推荐在小样本数据(n ≤ 100)情况下使用嵌套交叉验证(Nested Cross-Validation),外循环重复25次,K=5;在大样本数据中使用校正重采样t统计量(Corrected Resampled-t)方法,比值为0.9,重复25次。
When assessing the quality of prediction models in machine learning, confidence intervals (CIs) for the generalization error, which measures predictive performance, are a crucial tool. Luckily, there exist many methods for computing such CIs and new promising approaches are continuously being proposed. Typically, these methods combine various resampling procedures, most popular among them cross-validation and bootstrapping, with different variance estimation techniques. Unfortunately, however, there is currently no consensus on when any of these combinations may be most reliably employed and how they generally compare. In this work, we conduct a large-scale study comparing CIs for the generalization error, the first one of such size, where we empirically evaluate 13 different CI methods on a total of 19 tabular regression and classification problems, using seven different inducers and a total of eight loss functions. We give an overview of the methodological foundations and inherent challenges of constructing CIs for the generalization error and provide a concise review of all 13 methods in a unified framework. Finally, the CI methods are evaluated in terms of their relative coverage frequency, width, and runtime. Based on these findings, we can identify a subset of methods that we would recommend. We also publish the datasets as a benchmarking suite on OpenML and our code on GitHub to serve as a basis for further studies.
研究动机与目标
- 为解决在机器学习中哪些重采样和方差估计方法能可靠生成泛化误差置信区间(CIs)的问题上缺乏共识。
- 通过大规模基准测试,对13种现有、与模型无关的置信区间构建方法进行实证比较,覆盖多种表格回归与分类问题。
- 从覆盖率频率、置信区间宽度、计算成本和稳定性等多个维度,评估这些方法在不同数据规模、模型和损失函数下的表现。
- 基于实证结果,为实践者提供可操作的推荐建议,配套开源代码和在OpenML与GitHub上发布的数据集。
- 通过提供标准化的基准套件,为未来的方法论评估奠定基础,并强调实证验证与理论分析并重的重要性。
提出的方法
- 本研究评估了13种用于构建机器学习泛化误差置信区间的现有、与模型无关的方法,包括交叉验证、自助法(bootstrapping)以及方差估计技术的变体。
- 每种方法结合了不同的重采样程序(如K折交叉验证、重复交叉验证、自助法)与不同的方差估计策略(如刀切法、方差比、t统计量校正)。
- 基准测试使用了18个表格数据集——其中17个是为此项研究专门生成的——涵盖4种监督学习算法(诱导器,inducers)和8种损失函数,适用于分类与回归任务。
- 性能通过三个主要指标进行评估:相对覆盖率频率(真实泛化误差落在置信区间内的频率)、平均区间宽度(精度)和运行时间(计算成本)。
- 研究采用统一框架描述并比较全部13种方法,实现对多样化方法的一致评估与解释。
- 所有数据集均发布在OpenML上,代码在GitHub上开源,以支持可复现性与未来基准测试。
实验结果
研究问题
- RQ1哪些重采样与方差估计方法的组合能为泛化误差的置信区间提供最可靠的覆盖率频率?
- RQ2不同方法的置信区间宽度有何差异?覆盖率准确性与精度之间的权衡如何?
- RQ3每种方法的计算成本是多少?其随数据规模和模型复杂度的扩展特性如何?
- RQ4在小样本数据(n ≤ 100)与大样本数据(n > 100)之间,各方法的性能特征有何差异?
- RQ5哪些方法在不同数据生成过程、学习算法和损失函数下表现出鲁棒性与稳定性?
主要发现
- 对于小样本数据(n ≤ 100),嵌套交叉验证(Nested Cross-Validation)结合至少25次外循环重复和K=5,或保守Z统计量(Conservative-Z)结合25次外循环重复和K≥10,能提供最可靠的覆盖率,且区间宽度可接受。
- 对于大样本数据,校正重采样t统计量(Corrected Resampled-t)方法,比值为0.9,且重复次数不少于25次,能实现覆盖率准确性和区间宽度的最佳平衡。
- 当可接受稍宽的置信区间时,对于大样本数据,嵌套交叉验证(3次外循环重复,K=5)或保守Z统计量(10次外循环重复,K=5)也是推荐方案。
- 研究发现,覆盖率频率对方法配置高度敏感,部分方法在不同数据规模和模型类型下表现出显著的过度覆盖或覆盖不足。
- 计算成本差异显著:涉及重复模型拟合的方法(如重复交叉验证)显著慢于单次遍历或基于方差估计的方法。
- 基准测试表明,没有一种方法在所有指标上均全面优于其他方法,但有几种方法在覆盖率与区间宽度的平衡方面始终表现优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。