[论文解读] Radial and Directional Posteriors for Bayesian Neural Networks
本文提出了一种新型变分推断框架用于贝叶斯神经网络,采用径向后验与方向后验(RDP),将权重分布分解为幅度(径向)和方向(方向)分量。通过使用冯·米塞斯-费舍尔分布建模依赖关系,并利用半柯西先验与对数正态后验实现结构化剪枝,RDP在提升测试似然性的同时,实现了参数量与浮点运算量(FLOPs)更少的最先进压缩效果。
We propose a new variational family for Bayesian neural networks. We decompose the variational posterior into two components, where the radial component captures the strength of each neuron in terms of its magnitude; while the directional component captures the statistical dependencies among the weight parameters. The dependencies learned via the directional density provide better modeling performance compared to the widely-used Gaussian mean-field-type variational family. In addition, the strength of input and output neurons learned via the radial density provides a structured way to compress neural networks. Indeed, experiments show that our variational family improves predictive performance and yields compressed networks simultaneously.
研究动机与目标
- 为解决贝叶斯神经网络中均值场变分推断的局限性,即忽略权重参数之间的统计依赖关系。
- 开发一种能通过方向分量捕捉权重间相关性的变分族,以提升预测准确性。
- 通过径向后验分布的特性实现结构化神经网络剪枝,以突出低影响神经元。
- 在深度学习框架中实现高维冯·米塞斯-费舍尔分布的数值稳定训练。
- 通过联合建模权重幅度与方向,同时提升预测性能与模型效率。
提出的方法
- 将变分后验分解为每层权重向量的径向(幅度)与方向(角度)分量。
- 使用冯·米塞斯-费舍尔(vMF)分布对权重参数间的方向依赖关系进行建模,捕捉高维权重空间中的相关性。
- 提出一种新型修正贝塞尔函数比值的近似方法,以在高维vMF分布中实现稳定的梯度估计。
- 为径向分量采用半柯西先验与对数正态后验,以促进稀疏性并实现KL散度的闭式计算。
- 对vMF分布应用重参数化技巧,以在随机优化过程中实现可微采样。
- 将径向后验的众数用作剪枝阈值,以移除低影响神经元,实现结构化压缩。
实验结果
研究问题
- RQ1在贝叶斯神经网络中建模权重参数间的方向依赖关系,是否能超越均值场近似,实现更优的预测性能?
- RQ2径向后验是否可被有效用于结构化神经网络剪枝,同时保持高准确率?
- RQ3在深度学习中,对高维冯·米塞斯-费舍尔分布进行高效且稳定的变分推断是否可行?
- RQ4与现有方法相比,所提出的RDP方法在测试似然性和模型压缩效率方面表现如何?
- RQ5径向与方向后验的结合能否构成统一框架,同时实现不确定性建模与模型压缩?
主要发现
- 在回归任务中,RDP在9个数据集中的5个上优于均值场BNN(如变分推断与Dropout),测试对数似然性表现更优。
- 在LeNet-5上,RDP实现了具有竞争力的压缩性能,将FLOPs降低至125K,参数量减少至20K,同时保持1.0%的测试误差。
- 该方法在FLOPs效率上优于BC-GHS与BC-GNJ,仅使用20K参数与125K FLOPs,优于FDOO(100K)的FLOPs效率。
- 径向后验在半对数模式下的半径呈现清晰分离的聚类,支持在极小精度损失下实现有效剪枝。
- 所提出的贝塞尔函数近似可实现高维vMF分布的稳定训练,支持扩展至数千维的可扩展性。
- 方向分量捕捉到有意义的权重相关性,显著提升了预测性能,超越均值场基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。