Skip to main content
QUICK REVIEW

[论文解读] Improving Conditional Coverage via Orthogonal Quantile Regression

Shai Feldman, Stephen Bates|arXiv (Cornell University)|Jun 1, 2021
Machine Learning and Data Classification参考文献 46被引用 6
一句话总结

本文提出正交分位数回归,通过强制区间长度与误覆盖事件之间的统计独立性,提升预测区间的条件覆盖度,确保在所有特征子群体中均获得可靠的不确定性估计。该方法可增强传统及现代分位数回归模型,在真实世界数据集上显著提升条件覆盖度,同时引入新指标以评估覆盖有效性的强弱。

ABSTRACT

We develop a method to generate prediction intervals that have a user-specified coverage level across all regions of feature-space, a property called conditional coverage. A typical approach to this task is to estimate the conditional quantiles with quantile regression -- it is well-known that this leads to correct coverage in the large-sample limit, although it may not be accurate in finite samples. We find in experiments that traditional quantile regression can have poor conditional coverage. To remedy this, we modify the loss function to promote independence between the size of the intervals and the indicator of a miscoverage event. For the true conditional quantiles, these two quantities are independent (orthogonal), so the modified loss function continues to be valid. Moreover, we empirically show that the modified loss function leads to improved conditional coverage, as evaluated by several metrics. We also introduce two new metrics that check conditional coverage by looking at the strength of the dependence between the interval size and the indicator of miscoverage.

研究动机与目标

  • 解决标准分位数回归在有限样本及复杂模型(如神经网络)中条件覆盖度差的问题。
  • 开发一种训练方法,确保预测区间在特征空间的所有区域均保持用户指定的覆盖水平。
  • 引入新的、可解释的指标,用于评估区间长度与误覆盖之间依赖关系的强度,以指示条件覆盖失败。
  • 通过实证验证,强制覆盖与区间长度之间正交性可改善有限样本下的性能。
  • 在多种真实世界数据集和模型架构上展示该方法的有效性。

提出的方法

  • 通过添加正则化项修改分位数回归损失函数,以促进区间长度与误覆盖指示变量之间的统计独立性。
  • 采用双重稳健估计框架,即使在模型误设情况下,也能渐近保证正交性条件成立。
  • 利用真实条件分位数下,区间长度与误覆盖不相关这一事实,使该优化目标具有有效性和稳定性。
  • 引入两个新指标——皮尔逊相关系数与Hilbert-Schmidt独立性准则(HSIC),用于度量区间长度与误覆盖事件之间的依赖关系,以评估条件覆盖度。
  • 将该方法应用于经典及基于深度学习的分位数回归模型,包括用于边际覆盖校准的分位数回归校准方法(conformalized quantile regression)。
  • 采用大批次训练,以可靠估计区间长度与覆盖之间的依赖关系,实现有效的正则化。

实验结果

研究问题

  • RQ1强制区间长度与误覆盖之间统计独立性,能否改善分位数回归在有限样本下的条件覆盖度?
  • RQ2所提出的正交分位数回归方法在保持不同子群体覆盖度方面,相较于标准分位数回归表现如何?
  • RQ3新指标(如相关系数、HSIC)在检测标准评估方法所遗漏的条件覆盖违规方面,其检测能力有多强?
  • RQ4当与分位数推理结合以确保边际覆盖时,该方法是否仍保持有效性?
  • RQ5该方法能否推广至强制与其他特征函数(而非仅区间长度)之间的独立性?

主要发现

  • 所提出的正交分位数回归方法在九个真实世界数据集中显著提升了条件覆盖度,依赖性指标(如相关系数与HSIC)的平均提升达+40%至+88%。
  • 在meps_21数据集上,与基线CQR相比,该方法在Δ Node-Coverage指标中将误覆盖-长度依赖性降低了37.33%。
  • 经校准后,该方法实现了精确的边际覆盖度(90%),同时保持了更优的条件覆盖度,在facebook_1数据集上,相关系数指标提升了67.79%。
  • 在全部九个基准数据集中,该方法均优于标准分位数回归,在三项主要条件覆盖度指标(相关系数、HSIC、Δ WSC)上均取得一致提升。
  • 在高方差与不平衡数据集(如meps_19和meps_20)中,提升最为显著,覆盖可靠性得到显著增强。
  • 该方法在不同模型架构(包括前馈网络与深度神经网络)中均表现出鲁棒性,无论与原始分位数回归还是校准后分位数回归结合使用,效果均稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。