[论文解读] Expectation Propagation for Neural Networks with Sparsity-promoting Priors
本文提出了一种期望传播(EP)框架,用于在权重上使用促进稀疏性的层次先验,训练两层神经网络,从而实现对模型参数(包括权重尺度和噪声方差)的高效近似贝叶斯推断。该方法在计算效率上与稀疏线性模型的集成相当,同时支持灵活的先验分布,如拉普拉斯分布和自动相关性确定(ARD)高斯分布,在预测性能和对过拟合的鲁棒性方面优于MAP和MCMC基线方法。
We propose a novel approach for nonlinear regression using a two-layer neural network (NN) model structure with sparsity-favoring hierarchical priors on the network weights. We present an expectation propagation (EP) approach for approximate integration over the posterior distribution of the weights, the hierarchical scale parameters of the priors, and the residual scale. Using a factorized posterior approximation we derive a computationally efficient algorithm, whose complexity scales similarly to an ensemble of independent sparse linear models. The approach enables flexible definition of weight priors with different sparseness properties such as independent Laplace priors with a common scale parameter or Gaussian automatic relevance determination (ARD) priors with different relevance parameters for all inputs. The approach can be extended beyond standard activation functions and NN model structures to form flexible nonlinear predictors from multiple sparse linear models. The effects of the hierarchical priors and the predictive performance of the algorithm are assessed using both simulated and real-world data. Comparisons are made to two alternative models with ARD priors: a Gaussian process with a NN covariance function and marginal maximum a posteriori estimates of the relevance parameters, and a NN with Markov chain Monte Carlo integration over all the unknown model parameters.
研究动机与目标
- 通过在权重参数中引入层次先验来促进稀疏性,以解决高维输入特征下神经网络的过拟合问题。
- 为具有不可解析后验的非线性模型开发一种计算高效的贝叶斯推断方法,避免拉普拉斯近似和MCMC的局限性。
- 通过层次先验(如拉普拉斯分布和ARD高斯分布)实现对特征相关性的灵活建模,并自动确定输入特征的相关性。
- 为稀疏神经网络中的超参数学习提供一种可扩展且准确的MCMC和点估计方法的替代方案。
- 将期望传播的应用扩展到具有复杂非共轭似然和层次先验的非线性模型。
提出的方法
- 使用期望传播(EP)近似神经网络权重、层次尺度参数和残差方差的后验分布,利用因子化后验近似。
- 在神经网络权重上应用层次先验(如拉普拉斯分布和高斯ARD),以促进稀疏性并自动识别无关的输入特征。
- 采用针对各站点的倾斜分布和高斯近似,迭代更新后验站点参数,通过数值积分和Cholesky分解计算归一化项。
- 推导出空 cavity 分布的闭式更新,并采用自然参数化以确保收敛性,同时支持基于梯度的超参数优化。
- 通过近似边际似然来整合预测不确定性,该近似基于EP近似,支持基于梯度的超参数调优。
- 支持顺序和并行的EP更新,计算复杂度与训练稀疏线性模型的集成相当。
实验结果
研究问题
- RQ1期望传播能否为具有稀疏性诱导先验的贝叶斯神经网络提供一种准确且高效的替代MCMC和拉普拉斯近似的方案?
- RQ2使用层次先验(如拉普拉斯分布和ARD高斯分布)在非线性回归任务中如何影响模型的稀疏性和预测性能?
- RQ3所提出的基于EP的方法在预测准确性和对过拟合的鲁棒性方面是否优于基于MAP的ARD和MCMC方法?
- RQ4EP框架在具有通用激活函数和隐藏单元之间交互项的非线性模型中,其适用范围在多大程度上可以扩展?
- RQ5在后验不可解析的情况下,EP的边际似然近似能否有效用于超参数优化?
主要发现
- 基于EP的方法在预测性能上与MCMC相当,且优于基于MAP的ARD方法,尤其在存在无关特征的高维设置下表现更优。
- 结合EP使用层次先验可实现稳健的特征选择,能有效抑制无关输入,且不会导致过拟合,即使特征数量超过样本数量。
- 该算法的计算复杂度与训练独立稀疏线性模型的集成相似,使其适用于大规模问题。
- EP提供了比拉普拉斯近似更精确的后验近似,尤其在后验曲率因不可微分先验(如拉普拉斯分布)而难以定义时表现更优。
- EP提供的边际似然近似可有效支持基于梯度的超参数优化,如噪声方差和输入权重尺度,从而提升模型校准性。
- 在模拟数据和真实世界数据上的实证结果表明,该方法在保持高预测准确率的同时实现了强稀疏性,且通过相关性参数后验分布可清晰识别出相关特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。