Skip to main content
QUICK REVIEW

[论文解读] Variational Inference for Gaussian Process Models with Linear Complexity

Ching-An Cheng, Byron Boots|arXiv (Cornell University)|Nov 28, 2017
Gaussian Processes and Bayesian Inference参考文献 12被引用 21
一句话总结

本文提出了解耦高斯过程(DGPs),一种变分推断框架,将再生核希尔伯特空间中均值函数和协方差函数的表示分离开来。通过将均值和协方差的基函数解耦,该方法实现了在均值函数参数数量上具有线性时间与空间复杂度的随机梯度上升算法,显著提升了现有稀疏变分高斯过程方法的预测准确性,同时保持了可扩展性。

ABSTRACT

Large-scale Gaussian process inference has long faced practical challenges due to time and space complexity that is superlinear in dataset size. While sparse variational Gaussian process models are capable of learning from large-scale data, standard strategies for sparsifying the model can prevent the approximation of complex functions. In this work, we propose a novel variational Gaussian process model that decouples the representation of mean and covariance functions in reproducing kernel Hilbert space. We show that this new parametrization generalizes previous models. Furthermore, it yields a variational inference problem that can be solved by stochastic gradient ascent with time and space complexity that is only linear in the number of mean function parameters, regardless of the choice of kernels, likelihoods, and inducing points. This strategy makes the adoption of large-scale expressive Gaussian process models possible. We run several experiments on regression tasks and show that this decoupled approach greatly outperforms previous sparse variational Gaussian process inference procedures.

研究动机与目标

  • 解决标准高斯过程在大规模数据集上推理时的超线性时间与空间复杂度问题。
  • 克服由于诱导点集合较小而导致的稀疏变分高斯过程模型表达能力受限的问题。
  • 开发一种可扩展的变分推断框架,实现对均值函数与协方差函数表示的解耦。
  • 通过线性复杂度优化,实现对大规模复杂数据集的高精度高斯过程回归。
  • 证明增加均值函数基函数数量可提升预测性能,同时不牺牲计算效率。

提出的方法

  • 提出一种新颖的参数化方法,将用于建模均值函数和协方差函数的基函数在高斯过程中实现解耦。
  • 基于此解耦表示形式化变分推断问题,将诱导点视为变分参数。
  • 推导出一种随机梯度上升算法(svdgp),其时间复杂度为 O(DNmα + Nmβ² + mβ³),空间复杂度为 O(Nmα + mβ²),其中 mα 和 mβ 分别为均值函数和协方差函数的基函数数量。
  • 确保在 mα 上保持线性复杂度,无论核函数、似然函数或诱导点选择如何,从而支持使用大量 mα 以提升表达能力。
  • 采用完全可微分的框架,支持通过随机梯度进行端到端优化。
  • 将该方法应用于高斯过程回归任务,并在真实世界数据集(包括机器人控制与传感器数据)上进行评估。

实验结果

研究问题

  • RQ1在高斯过程模型中,解耦均值函数与协方差函数的表示是否能实现线性时间的变分推断?
  • RQ2增加均值函数基函数的数量是否能在不增加计算成本的前提下提升预测准确性?
  • RQ3所提出的方法是否能在保持线性复杂度的同时,优于现有的稀疏变分高斯过程算法?
  • RQ4与在线和批量变分高斯过程方法相比,该解耦框架在收敛速度与稳定性方面表现如何?
  • RQ5在在线学习设置中,该方法对超参数初始化与学习率选择是否具有鲁棒性?

主要发现

  • 在 kuka 1 数据集上,svdgp 算法实现了 1.262×10⁵ 的变分下界(VLB),显著优于 svi(0.391×10⁵)、i vsgpr(0.649×10⁵)和 vsgpr(0.472×10⁵)。
  • 在 kuka 1 数据集上,svdgp 实现了 0.037 的归一化均方误差(nMSE),远低于 svi(0.169)、i vsgpr(0.128)和 vsgpr(0.139)。
  • 在 mujoco 1 数据集上,svdgp 实现了 6.007×10⁵ 的 VLB,远超 svi(2.178×10⁵)、i vsgpr(4.543×10⁵)和 vsgpr(2.822×10⁵)。
  • svdgp 在 mujoco 1 上实现了 0.072 的 nMSE,显著低于 svi(0.163)、i vsgpr(0.099)和 vsgpr(0.118)。
  • 该方法表现出比 svi 更快的收敛速度和更好的稳定性,尽管 svi 与 i vsgpr 的收敛速度相近,但 svi 早期便出现性能下降。
  • 使用大量均值基函数(mα = 1024)同时保持协方差基函数数量较少(如 mβ = 256)可在不增加时间或空间复杂度超过 mα 线性增长的前提下实现高精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。