[论文解读] Towards calibrated and scalable uncertainty representations for neural networks
该论文提出 RECAST,一种新颖的贝叶斯神经网络参数估计方法,结合余弦退火与热重启技术及随机梯度朗之万动力学(SGLD),实现了可扩展且校准良好的不确定性估计。当与预测熵和认知不确定性结合时,RECAST 在损坏数据上实现了最低的期望校准误差(2.37%),并优于 SGLD、MCD、VI 和集成方法,其不确定性与模型准确性的相关性最佳。
For many applications it is critical to know the uncertainty of a neural network's predictions. While a variety of neural network parameter estimation methods have been proposed for uncertainty estimation, they have not been rigorously compared across uncertainty measures. We assess four of these parameter estimation methods to calibrate uncertainty estimation using four different uncertainty measures: entropy, mutual information, aleatoric uncertainty and epistemic uncertainty. We evaluate the calibration of these parameter estimation methods using expected calibration error. Additionally, we propose a novel method of neural network parameter estimation called RECAST, which combines cosine annealing with warm restarts with Stochastic Gradient Langevin Dynamics, capturing more diverse parameter distributions. When benchmarked against mutilated image data, we show that RECAST is well-calibrated and when combined with predictive entropy and epistemic uncertainty it offers the best calibrated measure of uncertainty when compared to recent methods.
研究动机与目标
- 为解决神经网络不确定性参数估计方法之间缺乏严谨比较的问题。
- 开发一种可扩展且校准良好的贝叶斯神经网络不确定性表示方法。
- 评估不同不确定性度量(熵、互信息、随机性、认知不确定性)在模型扰动下的表现。
- 探究参数估计方法的选择是否影响校准与不确定性表征。
- 证明 RECAST 能够更好地探索复杂后验分布,从而提升不确定性校准效果。
提出的方法
- 提出 RECAST,一种新型 SG-MCMC 方法,将余弦退火与热重启技术整合进随机梯度朗之万动力学(SGLD)。
- 使用余弦退火动态调整训练过程中的学习率,促进在参数空间中不同区域的探索。
- 采用 SGLD 进行后验采样,利用小批量梯度,保持计算复杂度为 O(m),确保可扩展性。
- 将 RECAST 与四种不确定性度量结合:预测熵、互信息、随机性不确定性与认知不确定性。
- 使用期望校准误差(ECE)作为主要指标,评估不同方法与扰动下的校准性能。
- 使用损坏的图像数据模拟分布偏移,评估不确定性的鲁棒性。
实验结果
研究问题
- RQ1在 SGLD 中结合余弦退火与热重启是否能改善贝叶斯神经网络的后验探索与不确定性校准?
- RQ2当使用相同的不确定性度量时,不同参数估计方法(如 SGLD、MCD、VI、集成)在校准性能上如何比较?
- RQ3在分布偏移下,哪种不确定性度量——预测熵、认知不确定性、互信息或随机性不确定性——最能反映模型置信度?
- RQ4当真实标签不可用时,认知不确定性能否作为模型准确性的可靠代理?
- RQ5在数据扰动逐渐增加的情况下,RECAST 是否相比现有方法保持更优的校准性能?
主要发现
- RECAST 实现了最低的期望校准误差(ECE)2.37%,优于 [6] 在相同数据集上得到的基线 ECE 值 3.02%。
- 当与预测熵和认知不确定性结合时,RECAST 在所有测试方法中提供了最校准良好的不确定性表征。
- RECAST 在 ECE 与数据损坏程度之间表现出强烈的线性相关性,表明其在分布偏移下具有稳定的校准能力。
- 通过 RECAST 估计的认知不确定性与实际模型准确度高度相关,使其能够在无真实标签的情况下可靠地作为预测置信度的代理。
- 权重分布分析表明,RECAST 比其他方法探索了更广泛且更多样化的参数空间,解释了其在不确定性表征上的优越性。
- 在所有方法中,RECAST 在数据扰动逐渐增加的情况下表现出最鲁棒的校准性能与不确定性映射能力,尤其在与认知不确定性及预测熵结合时。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。