[论文解读] Learning Prediction Intervals for Regression: Generalization and Calibration
本文提出了一种新颖的回归预测区间学习框架,通过约束经验优化同时优化区间宽度与覆盖率准确性。该框架引入了Lipschitz类与VC-子图类的一般学习理论,并采用高维Berry-Esseen定理进行校准,以确保有限样本下具有高置信度的覆盖率,其在测试数据上的覆盖率与区间宽度表现均优于现有方法。
We study the generation of prediction intervals in regression for uncertainty quantification. This task can be formalized as an empirical constrained optimization problem that minimizes the average interval width while maintaining the coverage accuracy across data. We strengthen the existing literature by studying two aspects of this empirical optimization. First is a general learning theory to characterize the optimality-feasibility tradeoff that encompasses Lipschitz continuity and VC-subgraph classes, which are exemplified in regression trees and neural networks. Second is a calibration machinery and the corresponding statistical theory to optimally select the regularization parameter that manages this tradeoff, which bypasses the overfitting issues in previous approaches in coverage attainment. We empirically demonstrate the strengths of our interval generation and calibration algorithms in terms of testing performances compared to existing benchmarks.
研究动机与目标
- 解决回归不确定性量化中预测区间宽度与覆盖率准确性之间的权衡问题。
- 构建一种一般学习理论,以确保区间模型的可行性(覆盖率)与最优性(窄宽度)。
- 通过引入基于统计理论的校准程序,克服覆盖率获取过程中的过拟合问题,提供高置信度保证。
- 实现以最小调整同时构建多个不同置信水平的预测区间。
提出的方法
- 将预测区间学习表述为经验约束优化问题,以最小化平均宽度并满足覆盖率约束。
- 引入敏感性度量以控制最优性与可行性之间的权衡,其理论基础为同时经验过程的偏差界。
- 应用高维Berry-Esseen定理推导出一种校准方法,确保有限样本下具有高置信度的覆盖率。
- 采用由统计理论指导的正则化参数选择策略,以防止过拟合并提升测试性能。
- 利用符号函数的强高斯浓度性质,为Lipschitz类与VC-子图类建立泛化界。
- 实现以最小重训练同时生成多个不同置信水平的预测区间。
实验结果
研究问题
- RQ1如何在理论上保证预测区间学习中区间宽度窄且覆盖率正确?
- RQ2何种一般学习理论可支持在神经网络与回归树等多样化模型类中联合优化覆盖率与宽度?
- RQ3如何设计一种校准程序,以确保高置信度、有限样本覆盖率,且不发生过拟合?
- RQ4所提方法是否能在测试数据上同时优于现有方法在覆盖率准确性和区间宽度方面的表现?
- RQ5该框架如何扩展以实现同时生成多个不同置信水平的预测区间?
主要发现
- 所提方法在测试数据上实现的覆盖率准确性高于基线方法,同时生成的预测区间显著更窄。
- 校准程序确保了有限样本下具有高置信度的覆盖率,其在区间宽度与置信度保证方面优于分治自适应推断方法。
- 理论分析为Lipschitz连续类与VC-子图类模型的覆盖率与宽度建立了泛化界。
- 实证结果表明,该方法在区间宽度上优于自适应学习与分位数回归方法,同时保持或提升了覆盖率。
- 该框架支持以最小重训练同时生成多个不同置信水平的预测区间,显著增强了决策灵活性。
- 利用高维Berry-Esseen定理使正则化参数选择更具鲁棒性,有效避免了覆盖率获取过程中的过拟合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。