Skip to main content
QUICK REVIEW

[论文解读] Bayesian Hypernetworks

David Krueger, Chin-Wei Huang|arXiv (Cornell University)|Oct 13, 2017
Gaussian Processes and Bayesian Inference参考文献 22被引用 16
一句话总结

本文提出贝叶斯超网络(BHNs),一种基于可逆超网络的变分推断框架,用于生成深度神经网络权重的复杂、相关且多模态的近似后验分布。通过利用归一化流实现高效采样和精确的熵估计,BHNs 在不确定性校准、对抗鲁棒性以及异常检测方面优于标准方法(如Dropout)。

ABSTRACT

We study Bayesian hypernetworks: a framework for approximate Bayesian inference in neural networks. A Bayesian hypernetwork $\h$ is a neural network which learns to transform a simple noise distribution, $p(\vecε) = \N(\vec 0,\mat I)$, to a distribution $q(\pp) := q(h(\vecε))$ over the parameters $\pp$ of another neural network (the "primary network")\@. We train $q$ with variational inference, using an invertible $\h$ to enable efficient estimation of the variational lower bound on the posterior $p(\pp | \D)$ via sampling. In contrast to most methods for Bayesian deep learning, Bayesian hypernets can represent a complex multimodal approximate posterior with correlations between parameters, while enabling cheap iid sampling of~$q(\pp)$. In practice, Bayesian hypernets can provide a better defense against adversarial examples than dropout, and also exhibit competitive performance on a suite of tasks which evaluate model uncertainty, including regularization, active learning, and anomaly detection.

研究动机与目标

  • 解决贝叶斯深度学习中单峰且因子分解的变分后验分布的局限性,后者常低估不确定性且无法捕捉复杂的参数依赖关系。
  • 开发一种可扩展且高效的深度神经网络近似贝叶斯推断方法,支持模型参数上丰富且相关的后验分布。
  • 提升安全关键应用中的模型不确定性估计,如主动学习、异常检测和对抗样本防御。
  • 证明贝叶斯超网络在不确定性量化以及对分布外移位和对抗攻击的鲁棒性方面优于标准方法(如MC Dropout)。

提出的方法

  • 使用可逆超网络 $ h $ 将简单的噪声先验 $ \mathcal{N}(\mathbf{0}, \mathbf{I}) $ 映射为复杂且灵活的后验分布 $ q(\boldsymbol{\theta}) = q(h(\boldsymbol{\epsilon})) $,以覆盖主网络参数的后验分布。
  • 利用归一化流(特别是RealNVP和IAF等可逆耦合层)确保超网络的可逆性和可微性,从而实现变分下界中对数似然和熵项的精确计算。
  • 通过最小化变分下界(ELBO)进行超网络的随机变分推断训练,其中使用 $ h $ 的雅可比行列式对数来校正采样过程中的测度变化。
  • 通过从 $ \boldsymbol{\epsilon} \sim \mathcal{N}(\mathbf{0}, \mathbf{I}) $ 独立同分布采样并将其输入 $ h $,实现从 $ q(\boldsymbol{\theta}) $ 的高效独立同分布采样,避免昂贵的MCMC或拒绝采样。
  • 设计参数高效且可扩展至大型主网络的超网络架构,克服了以往基于超网络的贝叶斯深度学习方法在可扩展性方面的局限。
  • 通过从 $ q(\boldsymbol{\theta}) $ 中抽取多个 $ \boldsymbol{\theta} $ 样本并进行多次前向传播,实现预测不确定性的蒙特卡洛估计,从而实现不确定性感知的预测。

实验结果

研究问题

  • RQ1是否可以利用超网络以支持高效采样和训练的方式,参数化深度神经网络权重的复杂、多模态且相关的近似后验分布?
  • RQ2使用可逆超网络是否能实现比标准变分近似(如高斯分布或Dropout)更准确且校准更好的不确定性估计?
  • RQ3贝叶斯超网络是否能通过在分布外或受扰动输入上提高认知不确定性,从而增强对对抗样本的鲁棒性?
  • RQ4在主动学习和异常检测任务中,贝叶斯超网络与MC Dropout及其他贝叶斯基线方法相比表现如何?
  • RQ5所提出的方法是否能在不带来过高计算成本的前提下,有效扩展至真实世界深度学习任务?

主要发现

  • 使用可逆超网络(如IAF和RealNVP)的贝叶斯超网络在不确定性校准方面显著优于MC Dropout和标准变分推断,尤其在检测对抗样本方面表现突出。
  • 在MNIST和CIFAR-10数据集上,采用IAF超网络的BHN在对抗检测任务中优于MC Dropout和基于RealNVP的BHN,对步长为0.01的FGSM攻击,AUC得分超过0.98。
  • 在异常检测任务中,BHN显著优于非贝叶斯模型和MC Dropout,使用置信度比率获取函数时,MNIST数据集的AUC-ROC得分为98.97,CIFARbw数据集为98.52。
  • BHN的BALD和平均标准差不确定性得分随对抗扰动增强而呈现显著上升趋势,表明其能可靠估计认知不确定性;而Dropout则无法捕捉该行为。
  • BHN在主动学习和正则化任务中表现出色,得益于其对复杂多模态后验分布的建模能力,实现了更优的不确定性感知预测。
  • 该方法在大型网络上具有良好的可扩展性,克服了以往对计算成本的担忧,实现了无需MCMC或拒绝采样的复杂后验分布的高效独立同分布采样。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。