Skip to main content
QUICK REVIEW

[论文解读] Masked Bayesian Neural Networks : Theoretical Guarantee and its Posterior Inference

Insung Kong, Dong‐Yoon Yang|arXiv (Cornell University)|May 24, 2023
Fault Detection and Control Systems被引用 4
一句话总结

本文提出了一种掩码贝叶斯神经网络(mBNN),在无需先验知识了解模型平滑性的情况下,实现了接近极小极大最优的后验集中率,并自适应地选择稀疏结构。该方法引入了一种新型的MCMC算法,采用局部有信息的提议分布,实现了高效的贝叶斯推断,在基准数据集上的泛化能力和不确定性量化方面优于现有方法。

ABSTRACT

Bayesian approaches for learning deep neural networks (BNN) have been received much attention and successfully applied to various applications. Particularly, BNNs have the merit of having better generalization ability as well as better uncertainty quantification. For the success of BNN, search an appropriate architecture of the neural networks is an important task, and various algorithms to find good sparse neural networks have been proposed. In this paper, we propose a new node-sparse BNN model which has good theoretical properties and is computationally feasible. We prove that the posterior concentration rate to the true model is near minimax optimal and adaptive to the smoothness of the true model. In particular the adaptiveness is the first of its kind for node-sparse BNNs. In addition, we develop a novel MCMC algorithm which makes the Bayesian inference of the node-sparse BNN model feasible in practice.

研究动机与目标

  • 开发一种具有强理论性质的节点稀疏贝叶斯神经网络(BNN)模型,以提升泛化能力和不确定性量化。
  • 建立接近极小极大最优的后验集中率,该率能自适应于真实模型的平滑性,这是节点稀疏BNN的首次实现。
  • 设计一种计算上可行的MCMC推断算法,专为节点稀疏BNN而定制,克服了现有变分推断和MCMC方法的局限性。
  • 展示mBNN在压缩深度神经网络方面的有效性,同时保持预测不确定性与性能。

提出的方法

  • 提出一种使用节点稀疏先验的掩码BNN(mBNN)模型,采用类似spike-and-slab的结构,在隐藏单元层面诱导稀疏性。
  • 采用一种新型的梅特罗波利斯-黑斯廷斯(Metropolis-Hastings)MCMC算法,结合局部有信息的提议分布,以高效探索稀疏网络结构的后验采样。
  • 引入一种掩码结构,其中每个隐藏单元关联一个二值掩码变量,实现对整个节点的选择性激活与剪枝。
  • 使用具有全局收缩参数λ的层次先验以控制稀疏性,允许根据数据复杂度自动选择网络结构。
  • 使用带有预 burn-in 阶段和去相关(thinning)的MCMC算法生成后验样本,确保收敛性并降低样本相关性。
  • 对MH算法进行适配,支持小批量训练,采用MHBT风格的修改,以在随机梯度下保持正确性和收敛性。

实验结果

研究问题

  • RQ1节点稀疏BNN能否在自适应于真实模型未知平滑性的同时,实现接近极小极大最优的后验集中率?
  • RQ2能否设计一种高效的MCMC算法,实现在节点稀疏BNN中无需依赖变分近似的实用贝叶斯推断?
  • RQ3与标准BNN和变分推断方法相比,mBNN在不确定性量化和泛化能力方面的表现如何?
  • RQ4mBNN在多大程度上能够压缩深度神经网络,同时保持预测性能和不确定性估计?

主要发现

  • mBNN实现了接近极小极大最优的后验集中率,且能自适应于真实模型的平滑性,这是节点稀疏BNN的首次实现。
  • 在UCI数据集上,当λ=0.1时,mBNN在95%可信区间(CI)中实现了93.3%的覆盖率,均方误差(RMSE)为2.902,负对数似然(NLL)为2.472,优于NS-VI和标准BNN。
  • 在CIFAR-10上,mBNN实现了93.3%的测试准确率,仅使用原始模型3.82%的浮点运算量(FLOPs),展示了高效的压缩能力和高效率。
  • mBNN在不同λ值下保持稳定性能,稀疏度水平与λ成正比,在回归和分类任务中均表现出鲁棒性。
  • 所提出的具有MHBT兼容性的MCMC算法能够在小批量数据上实现精确推断,同时保持收敛性和后验质量。
  • mBNN显著减少了激活节点的数量——例如,在波士顿数据集中从1000个减少到12个——而未牺牲预测性能或不确定性校准能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。