[论文解读] Bayesian Deep Learning via Subnetwork Inference
本文提出子网络推理,一种可扩展的贝叶斯深度学习方法,仅对神经网络权重中一小部分经过精心挑选的子集进行全协方差高斯后验近似,其余权重则保持为点估计。通过在子网络上使用线性化拉普拉斯近似,并结合基于Wasserstein距离的子网络选择策略,该方法实现了与深度集成方法相当的精确不确定性量化,同时在后验表达能力较弱的全网络贝叶斯方法中表现更优。
The Bayesian paradigm has the potential to solve core issues of deep neural networks such as poor calibration and data inefficiency. Alas, scaling Bayesian inference to large weight spaces often requires restrictive approximations. In this work, we show that it suffices to perform inference over a small subset of model weights in order to obtain accurate predictive posteriors. The other weights are kept as point estimates. This subnetwork inference framework enables us to use expressive, otherwise intractable, posterior approximations over such subsets. In particular, we implement subnetwork linearized Laplace as a simple, scalable Bayesian deep learning method: We first obtain a MAP estimate of all weights and then infer a full-covariance Gaussian posterior over a subnetwork using the linearized Laplace approximation. We propose a subnetwork selection strategy that aims to maximally preserve the model's predictive uncertainty. Empirically, our approach compares favorably to ensembles and less expressive posterior approximations over full networks. Our proposed subnetwork (linearized) Laplace method is implemented within the laplace PyTorch library at https://github.com/AlexImmer/Laplace.
研究动机与目标
- 为解决由于高维权重空间导致的大规模深度神经网络中贝叶斯推理的不可行性。
- 提升深度学习模型在分布偏移下的不确定性校准性和鲁棒性。
- 通过仅对权重中的一个小而关键的子集进行贝叶斯推理,降低计算成本,同时保持预测不确定性。
- 证明在子网络上使用表达能力强的后验近似,可达到或超越全网络贝叶斯方法和深度集成方法的性能。
提出的方法
- 首先对全神经网络中的所有权重计算最大后验估计(MAP)。
- 然后使用基于Wasserstein距离的准则选择一个小而具有代表性的权重子网络,以保留预测不确定性。
- 利用线性化拉普拉斯近似,在选定的子网络上推断全协方差高斯后验。
- 其余权重保持为固定点估计,通过在子网络后验上进行边际化实现高效预测。
- 在子网络选择过程中,使用对角近似以保证可扩展性,同时最小化对后验质量的影响。
- 最终预测结合了全网络的架构与子网络上的贝叶斯后验,实现不确定性感知的推理。
实验结果
研究问题
- RQ1在权重的小部分子集上进行贝叶斯推理,能否保留全神经网络的预测不确定性?
- RQ2在子网络上使用表达能力强的后验近似,是否能优于表达能力较弱的全网络贝叶斯方法?
- RQ3基于子网络的方法能否达到或超越深度集成方法的不确定性校准性能?
- RQ4子网络选择策略的选择如何影响后验质量和不确定性估计?
- RQ5在子网络选择阶段进行近似,是否比在后验推理阶段进行近似更高效且更有效?
主要发现
- 所提出的子网络(线性化)拉普拉斯方法在仅对极少部分权重进行贝叶斯推理的情况下,实现了与深度集成方法相当的不确定性校准和对分布偏移的鲁棒性。
- 该方法优于使用对角或分解后验的全网络贝叶斯方法,证明在子网络上使用表达能力强的后验近似,比在全网络上使用表达能力较弱的后验更有效。
- 基于全网络与子网络后验之间Wasserstein距离的子网络选择策略,显著提升了不确定性保留效果,即使在选择过程中使用对角近似也有效。
- 该方法在保持高预测准确性的同时,实现了对低维子空间的全协方差后验推理,使大规模模型的计算成为可能。
- 在MNIST、CIFAR10、Fashion-MNIST、SVHN以及表格型UCI数据集上的实证结果表明,与基线贝叶斯方法和集成方法相比,该方法在校准性和鲁棒性方面表现更优。
- 该方法在Laplace PyTorch库中实现了高效实现,支持可复现性,并可无缝集成到现有的深度学习工作流中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。