Skip to main content
QUICK REVIEW

[论文解读] Convergent Expectation Propagation in Linear Models with Spike-and-slab Priors

José Miguel Hernández-Lobato, Daniel Hernández-Lobato|arXiv (Cornell University)|Dec 10, 2011
Gaussian Processes and Bayesian Inference参考文献 10被引用 3
一句话总结

该论文提出了一种针对具有脉冲-稀疏先验的线性模型的可证明收敛的期望传播(PC-EP)算法,通过约束方差参数保持正值,确保每次迭代中最小化能量函数的有界性,从而实现收敛。实验表明,当标准EP无法收敛时,PC-EP能产生更优的后验近似,而在收敛时则与EP性能相当。

ABSTRACT

Exact inference in the linear regression model with spike and slab priors is often intractable. Expectation propagation (EP) can be used for approximate inference. However, the regular sequential form of EP (R-EP) may fail to converge in this model when the size of the training set is very small. As an alternative, we propose a provably convergent EP algorithm (PC-EP). PC-EP is proved to minimize an energy function which, under some constraints, is bounded from below and whose stationary points coincide with the solution of R-EP. Experiments with synthetic data indicate that when R-EP does not converge, the approximation generated by PC-EP is often better. By contrast, when R-EP converges, both methods perform similarly.

研究动机与目标

  • 解决在训练集极小时,标准常规顺序期望传播(R-EP)在具有脉冲-稀疏先验的线性模型中出现收敛失败的问题。
  • 开发一种确定性近似推理方法,保证收敛性,同时在R-EP收敛时保持其精度。
  • 通过约束方差参数为正值,确保算法最小化的能量函数有下界。
  • 在欠定回归设置($n \ll d$)中,为R-EP提供一种稳健的替代方案,此时稀疏性对避免过拟合至关重要。

提出的方法

  • PC-EP基于文献[3]中的算法,采用双层优化结构,其中每个外层循环最小化与EP近似相关的能量函数。
  • 通过施加对方差参数($\tilde{v}_{2i} > 0$)的约束,确保能量函数有下界,这是收敛的必要条件。
  • PC-EP最小化的能量函数被设计为使其驻点与标准R-EP的不动点一致,从而在收敛时与原始EP解保持一致。
  • 算法使用Woodbury公式在$\mathcal{O}(dn^2)$时间内计算后验精度矩阵$\mathbf{A}^{-1}$,每轮迭代的计算成本与R-EP相同。
  • 每次迭代在评估目标函数梯度时计算后验边际方差,与R-EP相比,常数因子增加了约两个数量级。
  • 该方法设计为可与快速优化技术(如[9]中的方法)兼容,以减少计算开销,尽管这一点留待未来工作。

实验结果

研究问题

  • RQ1能否为具有脉冲-稀疏先验的线性模型开发一种可证明收敛的期望传播变体,以解决标准R-EP无法收敛的问题?
  • RQ2将方差参数约束为正值是否能确保EP算法的收敛性,同时保持其精度?
  • RQ3当R-EP发散时,所提出的PC-EP算法在预测精度方面与标准R-EP相比如何?
  • RQ4在R-EP无法收敛的情况下,PC-EP的后验近似质量是否显著优于R-EP?

主要发现

  • 当R-EP无法收敛时,PC-EP在测试集上的平均均方误差(MSE)显著低于R-EP,PC-EP的平均MSE为0.15 ± 0.04,而R-EP为0.22 ± 0.06($\tau = 0.9$时)。
  • 在17个R-EP未收敛的测试集中,PC-EP在所有阻尼值$\tau \in \{0.1, 0.3, 0.5, 0.7, 0.9\}$下均实现了比R-EP更低的平均MSE。
  • 当R-EP收敛时(在83–94个数据集中),两种方法表现相似,PC-EP的平均MSE为0.033 ± 0.007,R-EP为0.024 ± 0.008($\tau = 0.9$时),表明预测精度相当。
  • 非收敛案例的数量随阻尼值增加而上升,在$\tau = 0.9$时,100个数据集中有17个未收敛,表明阻尼无法完全解决收敛问题。
  • PC-EP在非收敛情况下始终能产生比R-EP更优的后验近似,证明其在极端小样本情形下的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。