[论文解读] Calibrated Multivariate Distributional Regression with Pre-Rank Regularization
该论文提出一种可微分的基于预排序的正则化器,在训练分布回归模型时强制多变量校准,并提出了一种新颖的基于 PCA 的预排序,在18个真实世界数据集上显示出改进的多变量校准,同时不损害预测准确性。
The goal of probabilistic prediction is to issue predictive distributions that are as informative as possible, subject to being calibrated. Despite substantial progress in the univariate setting, achieving multivariate calibration remains challenging. Recent work has introduced pre-rank functions, scalar projections of multivariate forecasts and observations, as flexible diagnostics for assessing specific aspects of multivariate calibration, but their use has largely been limited to post-hoc evaluation. We propose a regularization-based calibration method that enforces multivariate calibration during training of multivariate distributional regression models using pre-rank functions. We further introduce a novel PCA-based pre-rank that projects predictions onto principal directions of the predictive distribution. Through simulation studies and experiments on 18 real-world multi-output regression datasets, we show that the proposed approach substantially improves multivariate pre-rank calibration without compromising predictive accuracy, and that the PCA pre-rank reveals dependence-structure misspecifications that are not detected by existing pre-ranks.
研究动机与目标
- 为跨越边际校准之外的已校准多变量预测分布的必要性提供动机。
- 在训练过程中开发一个可微分的正则化器,以便对所选的预排序函数实现校准。
- 引入基于 PCA 的预排序,以探测并在预测分布的主方向上强制校准。
- 通过仿真和18个真实世界数据集证明,正则化在不降低预测性能的前提下改善了多变量校准。
提出的方法
- 定义预排序函数,通过投影 PITs 将多变量校准简化为标量检查。
- 提出基于投影 PIT 的核平滑经验分布函数(PCE-KDE)来惩罚非均匀性,从而得到可微分的正则化项。
- 用一个在固定水平网格上对 Z_rho 的均匀性偏离进行惩罚的正则化项来扩充训练目标。
- 引入新的基于 PCA 的预排序,将 Y 投影到预测分布的主成分上,以检测相关结构的错误指定。
- 将现有的事后校准概念(HDR, copula)改编为训练时的预排序函数,以实现更广泛的校准检查。
- 提供一个端到端的训练算法(Algorithm 1),并配有特定的 PCA 预排序(Algorithm 2),以实现高效计算。

实验结果
研究问题
- RQ1如何在分布回归模型的训练过程中强制多变量校准?
- RQ2哪些预排序函数最能检测多变量预测中的不同形式的校准误差?
- RQ3基于预排序的正则化在不损害预测准确性的前提下,是否在多样数据集上改善了校准?
- RQ4PCA 基于的预排序是否揭示其他预排序未能发现的依赖结构错误?
- RQ5在现实世界的多输出回归任务中,校准模型的表现是否优于未正则化的基线?
主要发现
- 对所选预排序,正则化显著降低了概率性校准误差(PCE)。
- 正则化模型在不同预排序下的校准性得到提升,同时保持或改善了预测性能(NLL 和能量分数)。
- PCA 预排序检测到其他预排序未检测到的依赖结构错误,凸显其互补价值。
- 在18个真实世界数据集上,预排序正则化始终在不降低预测准确性的情况下提升了多变量校准。
- 该方法具有灵活性:可使用不同的预排序来针对不同的校准方面,包括边际、依赖性以及 HDR/copula 基于的检查。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。