[论文解读] On double-descent in uncertainty quantification in overparametrized models
本文针对过参数化二分类问题中的不确定性量化,提供了尖锐的渐近分析。研究揭示了正则化估计器在校准误差上存在双下降现象,同时表明经验贝叶斯方法即使在泛化误差较高的情况下仍保持良好校准,为现代机器学习模型中不确定性校准不足提供了理论洞见。
Uncertainty quantification is a central challenge in reliable and trustworthy machine learning. Naive measures such as last-layer scores are well-known to yield overconfident estimates in the context of overparametrized neural networks. Several methods, ranging from temperature scaling to different Bayesian treatments of neural networks, have been proposed to mitigate overconfidence, most often supported by the numerical observation that they yield better calibrated uncertainty measures. In this work, we provide a sharp comparison between popular uncertainty measures for binary classification in a mathematically tractable model for overparametrized neural networks: the random features model. We discuss a trade-off between classification accuracy and calibration, unveiling a double descent like behavior in the calibration curve of optimally regularized estimators as a function of overparametrization. This is in contrast with the empirical Bayes method, which we show to be well calibrated in our setting despite the higher generalization error and overparametrization.
研究动机与目标
- 提供过参数化模型中不确定性度量的严格数学比较。
- 研究高维设置下分类准确率与校准之间的权衡。
- 分析不同过参数化水平下校准曲线的行为。
- 在渐近分析下评估主流不确定性估计方法(如温度缩放和经验贝叶斯)的性能。
- 为现代深度学习设定下的不确定性量化建立理论保证。
提出的方法
- 使用随机特征模型作为具有结构化特征的二分类问题的可处理、可解框架。
- 应用渐近统计力学技术,包括近似消息传递和复制方法,推导泛化误差和校准的精确表达式。
- 比较多种不确定性估计器:经验风险最小化(ERM)、贝叶斯估计器(如拉普拉斯近似)以及证据最大化下的经验贝叶斯。
- 利用条件期望和后验近似,推导出期望置信度和校准误差的精确表达式。
- 对校准曲线作为过参数化程度(p/n)的函数进行详细分析,揭示双下降行为。
- 通过多种设置下的数值模拟验证结果,包括不同噪声水平和模型范数。
实验结果
研究问题
- RQ1在高维二分类中,正则化估计器的校准误差是否随过参数化程度(p/n)表现出双下降行为?
- RQ2经验贝叶斯与其它不确定性估计方法相比,在校准和泛化误差方面表现如何?
- RQ3正则化在缓解过参数化模型中的过度自信方面起什么作用?
- RQ4为何拉普拉斯近似等贝叶斯方法在高维设置下往往表现欠自信?
- RQ5温度缩放是否能在不同过参数化范围内有效校正基于 ERM 的估计器的校准误差?
主要发现
- 在最优正则化估计器(如 λloss 或 λerror 的 ERM)中,校准误差随过参数化程度(p/n)表现出双下降行为,表明准确率与校准之间存在权衡。
- 经验贝叶斯方法,特别是通过证据最大化(λevidence)实现的,即使在所有过参数化水平下也保持良好校准,尽管其泛化误差较高。
- 拉普拉斯近似在高维设定下始终产生欠自信的预测,尤其当 p/n 较大时更为明显。
- 温度缩放能有效校准基于 ERM 的估计器,且在对 λerror 的 ERM 应用时表现最佳。
- 真实后验置信度(f⋆|f̂)的方差随过参数化程度增加而增大,尤其在 ERM 估计器中,表明不确定性估计存在不稳定性。
- 理论分析证实,深度网络中的过度自信并非非线性的产物,即使在随机特征模型这类线性高维模型中也会出现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。