Skip to main content
QUICK REVIEW

[论文解读] Efficient Variational Inference for Sparse Deep Learning with Theoretical Guarantee

Jincheng Bai, Qifan Song|arXiv (Cornell University)|Nov 15, 2020
Stochastic Gradient Optimization Techniques被引用 7
一句话总结

该论文提出了一种计算高效的变分贝叶斯方法,用于稀疏深度神经网络,采用带有伯努利分布连续松弛的尖峰-滑板先验。该方法在理论上建立了后验一致性,并实现了最优收敛速率,在多层网络和真实世界数据集上均表现出色的不确定性量化和一致的变量选择性能。

ABSTRACT

Sparse deep learning aims to address the challenge of huge storage consumption by deep neural networks, and to recover the sparse structure of target functions. Although tremendous empirical successes have been achieved, most sparse deep learning algorithms are lacking of theoretical support. On the other hand, another line of works have proposed theoretical frameworks that are computationally infeasible. In this paper, we train sparse deep neural networks with a fully Bayesian treatment under spike-and-slab priors, and develop a set of computationally efficient variational inferences via continuous relaxation of Bernoulli distribution. The variational posterior contraction rate is provided, which justifies the consistency of the proposed variational Bayes method. Notably, our empirical results demonstrate that this variational procedure provides uncertainty quantification in terms of Bayesian predictive distribution and is also capable to accomplish consistent variable selection by training a sparse multi-layer neural network.

研究动机与目标

  • 为解决现有稀疏深度学习方法中缺乏理论支持的问题,特别是变分推理框架中的问题。
  • 开发一种计算高效的贝叶斯推理方法,在保持稀疏性的同时确保理论一致性。
  • 通过贝叶斯预测分布实现稀疏深度神经网络中的不确定性量化。
  • 通过利用尖峰-滑板先验并进行适当的超参数校准,实现在多层网络中的一致变量选择。
  • 通过结合计算效率与统计一致性,弥合理论稀疏深度学习与实际可扩展推理之间的差距。

提出的方法

  • 在深度神经网络的所有权重和偏置上施加尖峰-滑板先验,其中尖峰分量强制权重为零,而滑板分量允许非零值。
  • 使用伯努利分布的连续松弛以实现变分推理中的可微优化,避免离散采样。
  • 应用变分推理以近似稀疏网络结构的真实后验,将贝叶斯推理转化为优化问题。
  • 推导变分后验收缩速率,以在适当的超参数设置下理论上证明该方法的一致性。
  • 采用重参数化技巧和随机梯度下降(如Adam)以高效优化变分目标。
  • 校准边激活的先验概率,以平衡估计误差、变分误差和近似误差,实现最优收敛速率。

实验结果

研究问题

  • RQ1全贝叶斯方法在稀疏深度学习中能否同时实现计算效率和理论一致性?
  • RQ2在变分推理中对伯努利分布进行连续松弛是否能保持真实后验的稀疏结构?
  • RQ3所提出的方法能否在具有多个隐藏层的深度网络中实现一致的变量选择?
  • RQ4在不同超参数选择下,变分后验收缩速率的行为如何?是否能达到最优速率?
  • RQ5该方法能否通过贝叶斯预测分布在分布外输入上提供可靠的不确定性量化?

主要发现

  • 在所有UCI回归数据集上,该方法实现了最佳的测试RMSE,包括Kin8nm(0.08 ± 0.00)、Naval(0.00 ± 0.00)和Power Plant(4.01 ± 0.18),同时保持了高稀疏性(如Naval为82.9%)。
  • 在MNIST数据集上,该方法表现出优越的不确定性量化能力:对于模糊的叠加图像,其产生反映不确定性的概率输出,而频率学派基线则给出确定性预测。
  • 在Fashion-MNIST数据集上,该方法在80个周期后保持了比完整贝叶斯基线(VBNN)更高的测试准确率,而完整BNN则出现了过拟合。
  • 该方法在多层网络中实现了稳定的支撑集恢复,在变量选择任务中优于单层方法。
  • 后验稀疏性得到良好控制且可解释,报告值分别为Kin8nm为64.5%、Naval为82.9%、Year(90个特征)为20.8%,表明有效实现了结构恢复。
  • 理论分析证实,在适当的超参数调优下,变分后验收缩速率在估计误差、变分误差和近似误差之间实现了最优平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。