[论文解读] Good Initializations of Variational Bayes for Deep Models
该论文提出迭代贝叶斯线性建模(i-BLM),一种用于深度模型中随机变分推断(SVI)的逐层初始化策略,利用贝叶斯线性模型初始化变分后验。该方法可实现贝叶斯深度神经网络和卷积神经网络中更快、更稳定的收敛,并在简单高斯后验下实现与蒙特卡洛Dropout和噪声-KFAC相当的最先进性能。
Stochastic variational inference is an established way to carry out approximate Bayesian inference for deep models. While there have been effective proposals for good initializations for loss minimization in deep learning, far less attention has been devoted to the issue of initialization of stochastic variational inference. We address this by proposing a novel layer-wise initialization strategy based on Bayesian linear models. The proposed method is extensively validated on regression and classification tasks, including Bayesian DeepNets and ConvNets, showing faster and better convergence compared to alternatives inspired by the literature on initializations for loss minimization.
研究动机与目标
- 解决贝叶斯深度学习中随机变分推断(SVI)缺乏系统性初始化策略的问题。
- 通过利用贝叶斯线性模型进行初始化,提升SVI在深度模型中的收敛速度和解的质量。
- 在如CNN等复杂架构中,实现对简单高斯后验近似在SVI中的有效使用,其中不良初始化会导致平凡解。
- 通过实证验证,i-BLM在回归和分类任务中均优于基于损失最小化的初始化方法。
- 证明使用i-BLM初始化的SVI可在图像分类基准上实现与最先进方法(如蒙特卡洛Dropout和噪声-KFAC)相媲美的性能。
提出的方法
- i-BLM通过逐层训练贝叶斯线性模型,从每一层的激活值回归到目标标签,实现逐层初始化。
- 对于每一层l,该方法使用在前一层激活值上训练的贝叶斯线性回归模型,学习权重的后验分布。
- 利用贝叶斯线性模型学习到的后验均值和方差,初始化SVI中高斯后验的变分参数(均值和对数方差)。
- 初始化过程从第一层到最后一层逐层迭代执行,实现可扩展且高效的初始化,且计算开销可忽略。
- 该方法兼容前馈网络和卷积架构,包括LeNet-5、AlexNet和VGG16。
- 为应对过参数化问题,该方法在训练过程中逐步增加ELBO中的KL散度项,降低早期优化阶段先验的主导影响。
实验结果
研究问题
- RQ1基于贝叶斯线性模型的初始化是否能提升深度神经网络中随机变分推断的收敛性和性能?
- RQ2i-BLM是否能有效支持在深度卷积神经网络中使用分解高斯后验进行SVI训练,而标准初始化会失败?
- RQ3与基于损失最小化的初始化策略相比,i-BLM在收敛速度和最终性能方面表现如何?
- RQ4使用简单高斯后验和i-BLM初始化的SVI能否实现与蒙特卡洛Dropout和噪声-KFAC等先进方法相媲美的性能?
- RQ5先验设定对深度模型中SVI优化动态有何影响?
主要发现
- 与基于损失最小化的替代初始化方法相比,i-BLM显著加快了SVI的收敛速度,且在回归和分类任务中均观察到更快收敛。
- 在MNIST和CIFAR-10上,使用i-BLM的SVI在VGG16上测试负对数似然(NLL)为0.6443,优于蒙特卡洛Dropout(0.8213)和噪声-KFAC(0.7327)。
- 在CIFAR-10上,使用i-BLM的SVI在VGG16上的错误率为0.1682,与蒙特卡洛Dropout(0.2147)相比具有竞争力,且略优于噪声-KFAC(0.1506)。
- 借助i-BLM,SVI在深度卷积神经网络中成功避免了收敛到平凡解(后验等于先验)的问题,而这类问题在不良初始化下常发生。
- 该方法使SVI中简单的分解高斯后验在CIFAR-10上使用VGG16时实现了最先进性能,证明其在高度过参数化模型中的有效性。
- 消融研究证实,与替代初始化策略相比,i-BLM能带来更好的不确定性校准和更可靠的样本外不确定性估计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。