[论文解读] Tight Prediction Intervals Using Expanded Interval Minimization
本文提出了一种新型神经网络损失函数——扩展区间最小化(EIM),可直接预测紧致且覆盖约束的预测区间,无需假设误差分布对称。通过在小批量中缩放边界以满足目标覆盖度并最小化区间宽度,EIM在两个真实世界数据集上平均使区间宽度比现有方法缩小1.37倍,尤其在低覆盖度水平下显著优于最大似然估计(MLE)、集成方法和分位数回归技术。
Prediction intervals are a valuable way of quantifying uncertainty in regression problems. Good prediction intervals should be both correct, containing the actual value between the lower and upper bound at least a target percentage of the time; and tight, having a small mean width of the bounds. Many prior techniques for generating prediction intervals make assumptions on the distribution of error, which causes them to work poorly for problems with asymmetric distributions. This paper presents Expanded Interval Minimization (EIM), a novel loss function for generating prediction intervals using neural networks. This loss function uses minibatch statistics to estimate the coverage and optimize the width of the prediction intervals. It does not make the same assumptions on the distributions of data and error as prior work. We compare to three published techniques and show EIM produces on average 1.37x tighter prediction intervals and in the worst case 1.06x tighter intervals across two large real-world datasets and varying coverage levels.
研究动机与目标
- 为解决现有预测区间方法假设误差分布对称所带来的局限性,该局限性在真实世界非对称数据上导致次优性能。
- 开发一种在不依赖高斯噪声等分布假设的前提下,生成更紧致预测区间并保持正确覆盖度的方法。
- 实现灵活的、样本特定的预测区间分位数,使其能根据数据密度自适应调整,而非强制围绕均值对称设置边界。
- 相比集成方法降低训练复杂度,同时在神经网络基线方法上提升区间紧致性。
提出的方法
- EIM通过单一神经网络直接输出预测区间的下限和上限,无需为均值和方差分别训练独立模型。
- 损失函数首先利用经验分位数,将每个小批量中的预测边界缩放,以覆盖目标数据比例(例如90%)。
- 在确保覆盖度后,损失函数最小化缩放后边界的宽度,从而在保持正确性的前提下优化区间紧致性。
- 该方法使用小批量统计量估计覆盖度,使其与分布无关,适用于非对称数据。
- 与最大似然估计或集成方法不同,EIM不假设模型与噪声方差分量独立,也无需训练多个模型。
- 该方法支持每个样本的预测区间分位数不同,从而实现更自适应、更数据驱动的区间形状。
实验结果
研究问题
- RQ1基于神经网络的方法能否在不假设误差分布对称的前提下,生成比现有技术更紧致的预测区间?
- RQ2在不同覆盖度水平和真实世界数据集上,EIM与MLE、集成方法及分位数回归的性能相比如何?
- RQ3EIM根据数据密度自适应调整边界的特性是否能带来更紧致的区间,特别是在非对称分布中?
- RQ4与集成方法和分位数回归相比,EIM的训练复杂度和推理效率如何?
主要发现
- 在两个大型真实世界数据集及不同覆盖度水平下,EIM生成的预测区间平均比次优方法紧1.37倍。
- 在70%覆盖目标下,EIM的区间比次优技术紧1.26倍,而在90%覆盖目标下紧致性提升至1.06倍。
- 在低覆盖目标(如70%)下,EIM与其他方法的性能差距最大,这得益于其在区间形状上更大的灵活性。
- EIM预测的分布更倾向于数据的高密度区域,而对称方法则会等量地从均值向外扩展。
- 即使分位数回归需对两个超参数进行详尽的网格搜索,EIM仍表现更优,且避免了这一复杂过程。
- EIM是最快且最简单的方案,仅需一个神经网络;而集成方法需训练200个模型,复杂度显著更高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。