Skip to main content
QUICK REVIEW

[论文解读] Conditioning Sparse Variational Gaussian Processes for Online Decision-making

Wesley J. Maddox, Samuel C. Stanton|arXiv (Cornell University)|Oct 28, 2021
Gaussian Processes and Bayesian Inference被引用 5
一句话总结

本文提出在线变分调节(OVC),一种方法使随机变分高斯过程(SVGPs)能够通过证据下界(ELBO)在无需重新训练的情况下实时高效地对新数据进行条件化。OVC在保持SVGPs可扩展性的同时,实现了闭式后验更新,显著提升了其在贝叶斯优化、主动学习和强化学习中应用先进获取函数进行在线决策的适用性。

ABSTRACT

With a principled representation of uncertainty and closed form posterior updates, Gaussian processes (GPs) are a natural choice for online decision making. However, Gaussian processes typically require at least $\\mathcal{O}(n^2)$ computations for $n$ training points, limiting their general applicability. Stochastic variational Gaussian processes (SVGPs) can provide scalable inference for a dataset of fixed size, but are difficult to efficiently condition on new data. We propose online variational conditioning (OVC), a procedure for efficiently conditioning SVGPs in an online setting that does not require re-training through the evidence lower bound with the addition of new data. OVC enables the pairing of SVGPs with advanced look-ahead acquisition functions for black-box optimization, even with non-Gaussian likelihoods. We show OVC provides compelling performance in a range of applications including active learning of malaria incidence, and reinforcement learning on MuJoCo simulated robotic control tasks.

研究动机与目标

  • 解决在在线决策设置中高效对新数据进行高斯过程条件化的挑战。
  • 克服精确高斯过程(二次计算成本)和SVGPs(无闭式条件化)在流数据场景下的局限性。
  • 使SVGPs能够与高级前瞻获取函数(如批量知识梯度qKG)结合,用于黑箱优化。
  • 在在线学习中支持非高斯似然,例如通过高斯拷贝(Gaussian copulas)进行波动率建模。
  • 提供一种稳定且可扩展的替代方案,通过ELBO优化在新数据到达时避免重新训练SVGPs。

提出的方法

  • 开发OVC,一种新颖的程序,通过ELBO无需重新优化变分后验,即可对SVGPs进行新数据点的条件化。
  • 利用流式稀疏高斯过程(O-SGPR)的重新推导,实现在SVGPs中闭式后验更新。
  • 保持诱导点初始化的稳定性,并允许在新数据到来时自适应更新诱导点和变分参数。
  • 通过预测后验采样和高效的协方差更新,维持不确定性估计而无需完整重训练。
  • 将OVC与qKG和Thompson采样等获取函数集成,用于在线贝叶斯优化。
  • 通过在潜变量上进行条件化,支持非高斯似然,使其适用于波动率建模等非高斯场景。

实验结果

研究问题

  • RQ1是否可以通过ELBO实现SVGPs在无需重新训练的情况下对新数据进行实时条件化?
  • RQ2OVC是否能有效支持在线贝叶斯优化中高级前瞻获取函数(如qKG)的使用?
  • RQ3OVC在非高斯似然场景(如波动率建模)中是否能保持性能和稳定性?
  • RQ4在在线控制和主动学习中,OVC与精确高斯过程和标准SVGPs相比,在数据效率和计算成本方面表现如何?
  • RQ5在在线设置中,诱导点选择方式以及训练目标(ELBO与PLL)对OVC性能有何影响?

主要发现

  • OVC使SVGPs能够通过闭式更新对新数据进行条件化,消除了ELBO重新训练的需求,显著降低了计算成本。
  • 在Hartmann-6测试问题中,OVC增强的SVGPs在qKG和噪声水平0.1下实现了平均最优值3.18(±0.03),优于NEI,且与精确高斯过程性能相当。
  • 在MuJoCo探测器控制任务中,OVC与SVGPs实现了与精确高斯过程相当的数据效率,同时显著更快,且在大批次贝叶斯优化中,SVGPs的速度是精确模型的两倍。
  • 使用预测对数似然(PLL)训练SVGPs相比ELBO,在前瞻树搜索(LTS)中收敛略快且性能更优。
  • OVC改善了训练数据协方差矩阵的条件性,尤其在滚动预测中,使不同树深(如深度4)下均能实现稳定性能(例如,深度4已足够获得收益)。
  • 采用选主元Cholesky初始化的SGPR与OVC表现相当,但OVC在在线流数据场景下提供了更具可扩展性和稳定性的解决方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。