[论文解读] Combining Model and Parameter Uncertainty in Bayesian Neural Networks
本文提出了一种可扩展的变分推断方法,用于贝叶斯神经网络(BNNs),通过引入潜在二值变量来联合建模结构(模型)不确定性和参数不确定性。通过重新参数化边缘包含概率,该方法实现了贝叶斯模型平均和选择,从而在不损失预测性能的前提下显著提升网络稀疏性,同时为二值 dropout 提供了合理的概率解释。
Bayesian neural networks (BNNs) have recently regained a significant amount of attention in the deep learning community due to the development of scalable approximate Bayesian inference techniques. There are several advantages of using Bayesian approach: Parameter and prediction uncertainty become easily available, facilitating rigid statistical analysis. Furthermore, prior knowledge can be incorporated. However so far there have been no scalable techniques capable of combining both model (structural) and parameter uncertainty. In this paper we introduce the concept of model uncertainty in BNNs and hence make inference in the joint space of models and parameters. Moreover, we suggest an adaptation of a scalable variational inference approach with reparametrization of marginal inclusion probabilities to incorporate the model space constraints. Finally, we show that incorporating model uncertainty via Bayesian model averaging and Bayesian model selection allows to drastically sparsify the structure of BNNs.
研究动机与目标
- 解决当前缺乏可扩展技术来同时结合贝叶斯神经网络中的模型(结构)不确定性和参数不确定性的不足。
- 开发一种变分推断框架,实现在保持可扩展性的前提下,对 BNN 中的贝叶斯模型平均和选择。
- 通过将边缘包含概率与 dropout 率关联,为二值 dropout 提供概率解释。
- 证明联合建模模型与参数不确定性可显著提升 BNN 的稀疏性,同时保持高精度。
- 在基准数据集(MNIST、FMNIST)上评估该方法,并与现有 BNN 推断方法进行比较。
提出的方法
- 引入潜在二值变量以表示单个权重的包含或排除,从而在 BNN 中显式建模模型不确定性。
- 采用重参数化技巧处理边缘包含概率,使在联合模型-参数空间中实现高效且可扩展的随机变分推断成为可能。
- 使用完全因子化的变分近似方法,以高效处理高维参数空间。
- 应用贝叶斯模型平均(BMA)和中位概率模型(MPM)推断,对模型和参数进行边际化处理。
- 将所得的包含概率与二值 dropout 率关联,为 dropout 正则化提供合理的概率基础。
- 在权重上采用类似 spike-and-slab 的先验结构,并对包含概率施加层次先验,以促进稀疏性。
实验结果
研究问题
- RQ1能否有效且可扩展地将模型不确定性与参数不确定性联合引入贝叶斯神经网络?
- RQ2对模型和参数进行联合推断如何影响网络的稀疏性与预测性能?
- RQ3模型中得到的边缘包含概率能否为二值 dropout 提供合理的概率解释?
- RQ4与现有 BNN 推断技术相比,该方法在稀疏性和不确定性校准方面表现如何?
- RQ5该方法在实现显著权重剪枝的同时,是否仍能保持强大的预测性能?
主要发现
- 所提方法通过联合建模模型与参数不确定性,显著实现了 BNN 的稀疏化,在不损失预测准确性的情况下大幅减少了活跃权重数量。
- 在 MNIST 上,该方法生成的模型比标准 BNN 和 Concrete Dropout 更稀疏,同时保持了相当的预测性能。
- 在 FMNIST 上,该方法保持了良好的不确定性校准,分布熵在分布外设置下接近均匀分布,表明不确定性估计是校准良好的。
- 在分布外数据上,该方法的不确定性校准优于 Concrete Dropout,显示出对预测不确定性的更好处理能力。
- 模型中得到的边缘包含概率为 dropout 率提供了直接的概率解释,将贝叶斯推断与一种广泛使用的正则化技术联系起来。
- 该方法表明,贝叶斯模型平均与中位概率模型推断可生成有意义、稀疏且泛化能力强的 BNN 架构。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。