Skip to main content
QUICK REVIEW

[论文解读] Bayesian Neural Network Ensembles

Tim Pearce, Mohamed Zaki|arXiv (Cornell University)|Nov 27, 2018
Gaussian Processes and Bayesian Inference参考文献 11被引用 4
一句话总结

该论文提出了一种贝叶斯神经网络集成方法,通过在先验抽取的权重周围使用参数正则化的随机化MAP采样,在宽网络中生成一致的后验预测样本。通过从标准正态分布中独立同分布地抽取噪声并注入先验均值,该方法仅需5–10个模型即可实现准确的不确定性估计,在回归任务中优于标准集成方法以及VI和MC Dropout等近似贝叶斯方法。

ABSTRACT

Ensembles of neural networks (NNs) have long been used to estimate predictive uncertainty; a small number of NNs are trained from different initialisations and sometimes on differing versions of the dataset. The variance of the ensemble's predictions is interpreted as its epistemic uncertainty. The appeal of ensembling stems from being a collection of regular NNs - this makes them both scalable and easily implementable. They have achieved strong empirical results in recent years, often presented as a practical alternative to more costly Bayesian NNs (BNNs). The departure from Bayesian methodology is of concern since the Bayesian framework provides a principled, widely-accepted approach to handling uncertainty. In this extended abstract we derive and implement a modified NN ensembling scheme, which provides a consistent estimator of the Bayesian posterior in wide NNs - regularising parameters about values drawn from a prior distribution.

研究动机与目标

  • 开发一种可扩展且实用的贝叶斯神经网络推断方法,避免昂贵的MCMC或变分推断。
  • 弥合深度学习中经验性集成方法与原则性贝叶斯不确定性估计之间的差距。
  • 证明通过适当校准的噪声进行随机化MAP采样,可在宽神经网络中一致地近似真实后验分布。
  • 证明仅需少量模型(5–10个)即可有效捕捉预测不确定性。

提出的方法

  • 该方法使用一种修改后的损失函数,将网络参数正则化到一个随机抽取的先验均值附近,定义为 $\text{Loss}_{\text{anchor}} = \frac{1}{N}\|\mathbf{y}-\hat{\mathbf{y}}\|_2^2 + \frac{1}{N}\|\boldsymbol{\Gamma}^{1/2}(\boldsymbol{\theta}-\boldsymbol{\theta}_0)\|_2^2$,其中 $\boldsymbol{\theta}_0 \sim \mathcal{N}(\boldsymbol{\mu}_{\text{prior}}, \boldsymbol{\Sigma}_{\text{prior}})$。
  • 先验均值 $\boldsymbol{\theta}_0$ 的噪声分布被推导以确保所得MAP估计具有正确的后验均值和协方差,其中 $\boldsymbol{\Sigma}_0 = \boldsymbol{\Sigma}_{\text{prior}} + \boldsymbol{\Sigma}_{\text{prior}}^2 \boldsymbol{\Sigma}_{\text{like}}^{-1}$。
  • 对于宽神经网络,项 $\boldsymbol{\Sigma}_{\text{prior}}^2 \boldsymbol{\Sigma}_{\text{like}}^{-1}$ 会消失,因此可将 $\boldsymbol{\Sigma}_0 = \boldsymbol{\Sigma}_{\text{prior}}$ 作为有效近似。
  • 集成中的每个模型通过使用不同的 $\boldsymbol{\theta}_0$ 最小化锚定损失独立训练,从而产生后验预测分布的独立同分布样本。
  • 该方法避免向似然(如目标)注入噪声,因为这在非线性模型中复杂且不一致,而是将先验均值作为唯一噪声源。
  • 该方法在假设后验在宽网络中由先验主导的前提下具有理论依据,这一假设在过参数化的贝叶斯神经网络中成立。

实验结果

研究问题

  • RQ1在宽贝叶斯神经网络中,通过向先验均值注入噪声的随机化MAP采样能否产生对真实后验的一致估计?
  • RQ2在集成中需要多少模型才能在预测空间中实现可靠的不确定性估计?
  • RQ3为何标准集成方法在分布外区域无法捕捉认知不确定性,且能否通过适当的先验正则化加以纠正?
  • RQ4是否可以使用一种简单且可扩展的方法近似黄金标准贝叶斯推断(如HMC或GP),而无需MCMC或变分推断?
  • RQ5该方法在捕捉参数相关性和预测不确定性方面是否优于现有可扩展的贝叶斯深度学习方法(如VI和MC Dropout)?

主要发现

  • 所提出的方法在具有ReLU、S型和RBF激活函数的玩具回归问题上,其预测分布能紧密逼近哈密顿蒙特卡洛和高斯过程的黄金标准。
  • 由于能够建模参数相关性,该方法在捕捉认知不确定性方面优于均场VI和MC Dropout,尤其是在插值区域。
  • 尽管存在一定程度的方差高估,该方法仍能定性地准确近似真实后验预测分布。
  • 仅需5–10个模型的集成规模即可实现良好的不确定性估计,且该数量不随输入或输出维度的增加而增长。
  • 该方法正确再现了RBF高斯过程在分布外区域的行为,包括在远离训练数据时的高置信度零预测。
  • 在十个标准基准数据集上,该方法在认知不确定性为主要不确定性来源的任务中优于深度集成,展现出更优的不确定性量化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。