Skip to main content
QUICK REVIEW

[论文解读] Radial Bayesian Neural Networks: Beyond Discrete Support In Large-Scale Bayesian Deep Learning

Sebastian Farquhar, Michael A. Osborne|arXiv (Cornell University)|Jul 1, 2019
Gaussian Processes and Bayesian Inference参考文献 29被引用 21
一句话总结

本文提出径向贝叶斯神经网络(Radial BNNs),一种变分推断方法,通过在超球面空间中用径向分布替代均值场高斯后验,避免了高维高斯分布的‘肥皂泡’病理现象。该方法实现了对权重空间的完整支持,降低了梯度方差,并在无需超参数调优的情况下,在大规模医学影像任务中优于蒙特卡洛丢弃和深度集成方法。

ABSTRACT

We propose Radial Bayesian Neural Networks (BNNs): a variational approximate posterior for BNNs which scales well to large models while maintaining a distribution over weight-space with full support. Other scalable Bayesian deep learning methods, like MC dropout or deep ensembles, have discrete support-they assign zero probability to almost all of the weight-space. Unlike these discrete support methods, Radial BNNs' full support makes them suitable for use as a prior for sequential inference. In addition, they solve the conceptual challenges with the a priori implausibility of weight distributions with discrete support. The Radial BNN is motivated by avoiding a sampling problem in 'mean-field' variational inference (MFVI) caused by the so-called 'soap-bubble' pathology of multivariate Gaussians. We show that, unlike MFVI, Radial BNNs are robust to hyperparameters and can be efficiently applied to a challenging real-world medical application without needing ad-hoc tweaks and intensive tuning. In fact, in this setting Radial BNNs out-perform discrete-support methods like MC dropout. Lastly, by using Radial BNNs as a theoretically principled, robust alternative to MFVI we make significant strides in a Bayesian continual learning evaluation.

研究动机与目标

  • 为解决均值场变分推断(MFVI)中高维高斯分布样本不具代表性、导致梯度方差过高的‘肥皂泡’病理现象。
  • 开发一种在权重空间上具有完整支持的可扩展贝叶斯神经网络方法,避免蒙特卡洛丢弃和深度集成等方法的离散支持问题。
  • 构建一种鲁棒且对超参数不敏感的推断方法,适用于真实世界的大规模深度学习任务,如医学图像分类。
  • 使BNN后验可作为持续学习中的数据相关先验,克服零概率先验的局限性。

提出的方法

  • 为每个网络层提出一种在超球面空间中的径向近似后验分布,通过径向基函数将其映射到权重空间。
  • 将后验定义为单位球面上的分布,其中径向分量从一元分布(如伽马分布或逆伽马分布)中抽取,确保样本聚集在均值附近。
  • 推导出证据下界(ELBO)的解析表达式,实现无需显式坐标变换的高效训练。
  • 使用拒绝采样截断MFVI中的高斯先验作为基线比较,表明即使存在偏差,低方差估计器仍能提升性能。
  • 使用标准深度学习框架实现该方法,保持与MFVI相当的训练速度和实现简便性。
  • 将该方法应用于一个1500万参数的模型,在高维输入(约23万维)的糖尿病视网膜病变检测任务中进行测试。

实验结果

研究问题

  • RQ1径向后验分布能否缓解高维均值场变分推断中的‘肥皂泡’病理现象?
  • RQ2具有完整支持的后验是否能提升大规模贝叶斯深度学习中对超参数选择的鲁棒性?
  • RQ3径向BNN是否能在真实世界、高维的医学影像任务中超越MC丢弃和深度集成等最先进方法?
  • RQ4径向BNN后验能否在持续学习设置中作为有效且数据相关的先验?
  • RQ5性能提升是否源于更具有代表性的后验样本所导致的梯度方差降低?

主要发现

  • 径向BNN在真实世界的糖尿病视网膜病变分类任务中优于蒙特卡洛丢弃和深度集成方法,实现了更低的测试RMSE和更高的预测对数似然。
  • 在UCI回归基准测试中,径向BNN达到最先进性能,葡萄酒数据集的平均测试RMSE为0.64 ± 0.01,Kin8nm数据集为0.07 ± 0.00,优于MFVI及其他基线方法。
  • 该方法对超参数选择具有鲁棒性,在不同权重初始化方差和学习率下均表现出稳定性能。
  • 截断MFVI(使用拒绝采样)虽能提升性能,但仍逊于径向BNN,表明MFVI的核心问题在于高梯度方差。
  • 径向BNN保持了对权重空间的完整支持,使其可作为持续学习中的先验,相比离散支持方法更有效地防止灾难性遗忘。
  • 解析ELBO推导使训练效率与标准MFVI相当,无额外计算开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。