[论文解读] Global inducing point variational posteriors for Bayesian neural networks and deep Gaussian processes
本文提出了一种用于贝叶斯神经网络(BNNs)和深度高斯过程(DGPs)的全局诱导点变分后验,通过在输入层学习全局诱导点并将其传播至网络深层,以建模层间相关性。该方法在CIFAR-10上实现了当前最优的变分方法性能(准确率86.7%),无需数据增强或温度调节,优于标准的局部诱导点方法,并接近SGMCMC的性能表现。
We consider the optimal approximate posterior over the top-layer weights in a Bayesian neural network for regression, and show that it exhibits strong dependencies on the lower-layer weights. We adapt this result to develop a correlated approximate posterior over the weights at all layers in a Bayesian neural network. We extend this approach to deep Gaussian processes, unifying inference in the two model classes. Our approximate posterior uses learned "global" inducing points, which are defined only at the input layer and propagated through the network to obtain inducing inputs at subsequent layers. By contrast, standard, "local", inducing point methods from the deep Gaussian process literature optimise a separate set of inducing inputs at every layer, and thus do not model correlations across layers. Our method gives state-of-the-art performance for a variational Bayesian method, without data augmentation or tempering, on CIFAR-10 of 86.7%, which is comparable to SGMCMC without tempering but with data augmentation (88% in Wenzel et al. 2020).
研究动机与目标
- 为解决标准变分推断在BNNs和DGPs中的局限性,即假设各层后验独立,无法捕捉层间相关性。
- 通过在两类模型中统一应用相同的后验结构,建立BNNs和DGPs的统一推断框架。
- 通过学习在深层网络中传播的全局诱导点,而非为每层单独优化,提升贝叶斯深度学习的预测性能。
- 提供一种可扩展且高效的推断方法,在保持强不确定性量化能力的同时,实现标准基准测试中的高准确率。
提出的方法
- 该方法通过在顶层表示上进行贝叶斯线性回归,推导出BNN中顶层权重的最优近似后验,从而自然地诱导出层间的相关性。
- 在每一层引入学习得到的“伪输出”,并利用从低层传播的输入到这些伪输出的贝叶斯线性回归,定义权重的后验分布。
- 仅在输入层定义全局诱导点,并将其传播至深层以生成深层的诱导输入,避免对每层单独优化诱导输入。
- 该方法采用变分推断框架,其结构化后验依赖于整个网络的低层表示,而不仅限于局部权重。
- 对于卷积层,该方法包含一种高效实现,既保持计算可处理性,又保留了诱导点的全局结构。
- 通过将每一层视为具有全局诱导点的高斯过程,将该框架扩展至DGPs,实现了BNNs与DGPs之间推断的统一。
实验结果
研究问题
- RQ1与逐层独立的局部诱导点相比,从输入层传播的全局诱导点策略是否能改善贝叶斯神经网络中的后验近似?
- RQ2在后验中建模层间相关性如何影响深度模型的预测性能和不确定性校准?
- RQ3相同的变分后验结构能否有效应用于贝叶斯神经网络和深度高斯过程,从而实现统一的推断框架?
- RQ4在非温度调节、无数据增强的设置下,该方法在图像分类基准(如CIFAR-10)上的性能如何?
主要发现
- 所提方法在CIFAR-10上使用变分贝叶斯神经网络实现了86.7%的测试准确率,是无需数据增强或温度调节的变分方法中的最先进性能。
- 在深度高斯过程中的标准局部诱导点方法上,该方法表现更优,在包括energy、naval和power在内的多个回归数据集上均获得了显著更高的ELBO值。
- 在energy数据集上,全局诱导点方法的ELBO为1.48,高于局部诱导点的1.47,表明性能持续提升。
- 在naval数据集上,深度为2时,全局诱导点方法的ELBO达到3.89,而局部诱导点仅为3.01,显示出建模能力的显著提升。
- 全局诱导点方法保持了良好的不确定性校准,如在protein和wine等回归任务中表现出较低的负对数似然值。
- 该方法实现了BNNs与DGPs的统一推断框架,表明相同的后验结构可一致地应用于两类模型并取得一致的性能增益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。