[论文解读] Noise Contrastive Priors for Functional Uncertainty
本文提出了噪声对比先验(NCPs),一种数据空间先验,通过对比干净输入与噪声扰动,促使神经网络对分布外(OOD)输入输出高不确定性。NCPs改进了贝叶斯神经网络和分布外分类器的不确定性估计,显著提升了主动学习性能,并可扩展至大规模回归任务(如航班延误预测),在该任务中实现了SOTA结果,且NLPD和RMSE更低。
Obtaining reliable uncertainty estimates of neural network predictions is a long standing challenge. Bayesian neural networks have been proposed as a solution, but it remains open how to specify their prior. In particular, the common practice of an independent normal prior in weight space imposes relatively weak constraints on the function posterior, allowing it to generalize in unforeseen ways on inputs outside of the training distribution. We propose noise contrastive priors (NCPs) to obtain reliable uncertainty estimates. The key idea is to train the model to output high uncertainty for data points outside of the training distribution. NCPs do so using an input prior, which adds noise to the inputs of the current mini batch, and an output prior, which is a wide distribution given these inputs. NCPs are compatible with any model that can output uncertainty estimates, are easy to scale, and yield reliable uncertainty estimates throughout training. Empirically, we show that NCPs prevent overfitting outside of the training distribution and result in uncertainty estimates that are useful for active learning. We demonstrate the scalability of our method on the flight delays data set, where we significantly improve upon previously published results.
研究动机与目标
- 解决神经网络中对分布外(OOD)输入不确定性估计不可靠的挑战。
- 克服标准权重空间独立正态先验在约束函数空间不确定性方面的局限性。
- 开发一种可扩展的数据空间先验,促使模型在OOD输入上输出高不确定性,且无需复杂模型重参数化。
- 通过使模型能够识别并优先选择信息量大、不确定性高的数据点,提升主动学习性能。
- 在大规模回归基准(如航班延误预测)上展示该方法的可扩展性与鲁棒性。
提出的方法
- 引入一种基于输入噪声注入的数据空间先验:对于每个小批量,从对称分布(如正态或均匀分布)中采样噪声对输入进行扰动。
- 使用对比损失函数训练模型区分干净输入与噪声输入,使模型学习到对噪声输入(类似OOD)分配更高不确定性。
- 将此对比目标与针对噪声输入的宽输出先验(如宽泛的高斯分布)结合,确保在OOD区域具有高预测方差。
- 利用所得的不确定性估计作为模型认知不确定性(epistemic uncertainty)的代理,从而提升主动学习与OOD检测性能。
- 将NCPs与现有不确定性感知模型(如贝叶斯神经网络(BBB)和分布外分类器(ODC))集成,无需修改网络架构。
- 采用类似噪声对比估计(NCE)的损失函数,最大化干净输入的对数似然,同时最小化噪声输入的对数似然,从而在数据空间中有效学习函数先验。
实验结果
研究问题
- RQ1数据空间先验能否改进神经网络的不确定性估计,特别是对分布外输入的估计?
- RQ2与标准权重空间先验相比,所提出的NCP方法在OOD泛化能力和主动学习性能方面表现如何?
- RQ3NCP方法对输入噪声分布和扰动方差的变化是否具有鲁棒性?
- RQ4NCP能否有效扩展至包含数十万训练样本的大规模回归任务?
- RQ5引入NCP后,是否能更有效地分离预测分布中的认知不确定性与偶然性噪声?
主要发现
- NCPs显著改进了贝叶斯神经网络和分布外分类器的不确定性估计,降低了对OOD输入的过度自信。
- 在航班延误数据集上,BBB+NCP与ODC+NCP分别实现NLPD为4.38和RMSE为24.71与24.68,达到SOTA性能,优于先前方法。
- NCP方法通过使模型能够选择更具信息量、更高不确定性的样本,显著提升了主动学习性能,实现更快收敛与更好泛化。
- NCPs对输入噪声方差和分布的变化具有鲁棒性,在不同噪声模式(如σ² ∈ [0.1, 1.0]的均匀或正态噪声)下均保持一致性能。
- 在大规模回归任务中,NCPs可有效扩展至70万训练样本,证明其在真实工业场景中的可行性。
- 该方法成功分离了认知不确定性与偶然性噪声,可视化结果清晰展示了预测分布中可区分的不确定性与噪声分量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。