Skip to main content
QUICK REVIEW

[论文解读] Scalable Gaussian Processes with Grid-Structured Eigenfunctions (GP-GRIEF)

Trefor W. Evans, Prasanth B. Nair|arXiv (Cornell University)|Jul 5, 2018
Gaussian Processes and Bayesian Inference被引用 12
一句话总结

GP-GRIEF 提出了一种可扩展的高斯过程方法,该方法基于密集的笛卡尔网格诱导点上的 Nyström 近似,生成网格结构的特征函数。通过利用 Kronecker 和 Khatri-Rao 积代数,其在每次对数边际似然评估中实现了 $Ó(p)$ 的时间与内存复杂度,且与诱导点数量 $m$ 无关,从而支持 $m \gg n$ 的高精度核近似,并可在高达两百万个样本的数据集上实现类型-I 贝叶斯推断。

ABSTRACT

We introduce a kernel approximation strategy that enables computation of the Gaussian process log marginal likelihood and all hyperparameter derivatives in $\mathcal{O}(p)$ time. Our GRIEF kernel consists of $p$ eigenfunctions found using a Nystrom approximation from a dense Cartesian product grid of inducing points. By exploiting algebraic properties of Kronecker and Khatri-Rao tensor products, computational complexity of the training procedure can be practically independent of the number of inducing points. This allows us to use arbitrarily many inducing points to achieve a globally accurate kernel approximation, even in high-dimensional problems. The fast likelihood evaluation enables type-I or II Bayesian inference on large-scale datasets. We benchmark our algorithms on real-world problems with up to two-million training points and $10^{33}$ inducing points.

研究动机与目标

  • 为克服结构化诱导点方法在输入维度 $d$ 上呈指数级增长的维度灾难问题。
  • 消除对诱导点数量 $m$ 的计算依赖,从而允许 $m \gg n$,以实现高精度的核近似。
  • 通过使对数边际似然和超参数导数的计算复杂度保持在 $Ó(p)$ 时间内,实现大规模数据集上的高效类型-I 贝叶斯推断。
  • 开发一种基于特征函数权重的核重参数化方法,以支持灵活且有原则的贝叶斯推断。
  • 在真实世界数据集上展示该方法在高达两百万个训练样本和 $m = 10^{33}$ 个诱导点下的可扩展性与准确性。

提出的方法

  • 该方法在密集的笛卡尔积诱导点网格上使用 Nyström 近似来计算 $p$ 个特征函数,形成核近似。
  • 通过利用 Kronecker 和 Khatri-Rao 积的代数性质,将大型核矩阵分解为低维运算,将复杂度降低至 $Ó(p)$。
  • 使用特征函数基来重参数化核函数,使得对数边际似然及全部 $p+1$ 个超参数导数均可在 $Ó(p)$ 时间内计算。
  • 该方法采用灵活的参数化方式,将核函数表示为特征函数的加权和,从而通过 MCMC 实现类型-I 贝叶斯推断。
  • 从相同的代数框架中推导出适用于一般核矩阵的高效预条件子,扩展了其适用范围。
  • 该方法支持类型-I(完全贝叶斯)和类型-II(经验贝叶斯)推断,其中类型-I 通过在基函数权重上进行 MCMC 采样实现。

实验结果

研究问题

  • RQ1能否使结构化诱导点高斯过程的计算复杂度在实际中与诱导点数量 $m$ 几乎无关?
  • RQ2能否利用 Kronecker 和 Khatri-Rao 积结构来缓解维度 $d$ 带来的指数级增长问题?
  • RQ3大量诱导点 $m$ 是否能带来更精确的全局核近似,且能否高效计算?
  • RQ4基于特征函数的核近似是否能用于实现在大规模数据集上的高效类型-I 贝叶斯推断?
  • RQ5该方法在真实世界数据集上的表现如何,特别是当训练样本高达两百万个且 $m = 10^{33}$ 时?

主要发现

  • GP-GRIEF 在每次对数边际似然评估中实现了 $Ó(p)$ 的时间和内存复杂度,且与 $m$ 无关,从而即使在 $m = 10^{33}$ 个诱导点下也能实现高效训练。
  • 在小规模数据集($n < 2000$)上,GP-GRIEF 的性能优于精确 GP 和其他近似方法,其中 GP-GRIEF-I 因贝叶斯正则化而表现出强鲁棒性。
  • 在高达两百万个样本的大规模数据集上,GP-GRIEF-II 和 GP-GRIEF-I 的测试误差与当前最先进方法相当或更优,包括使用 Fastfood 近似的方法。
  • 在两百万样本的电力数据集上,通过 MCMC 实现的类型-I 贝叶斯推断仅耗时 25 分钟,证明了完全贝叶斯高斯过程推断的实际可扩展性。
  • Nyström 特征函数近似在 $m$ 趋于无穷大时收敛于真实核的特征函数,验证了该方法的理论基础。
  • 该方法的计算效率使得 $m \gg n$ 成为可能,从而即使在远离训练数据的测试点上,也能实现精确的全局核近似。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。