Skip to main content
QUICK REVIEW

[论文解读] Scalable Gaussian Processes with Billions of Inducing Inputs via Tensor Train Decomposition

Pavel Izmailov, Alexander Novikov|arXiv (Cornell University)|Oct 19, 2017
Gaussian Processes and Bayesian Inference参考文献 4被引用 10
一句话总结

该论文提出TT-GP,一种可扩展的高斯过程方法,利用张量列车(TT)分解实现数十亿个诱导输入的训练,在回归和分类基准测试中达到最先进性能。通过结合TT格式的变分参数与克罗内克结构协方差及深度核学习,TT-GP实现了与特征空间维度线性缩放,从而在不修改高斯过程框架的前提下,有效建模高维数据。

ABSTRACT

We propose a method (TT-GP) for approximate inference in Gaussian Process (GP) models. We build on previous scalable GP research including stochastic variational inference based on inducing inputs, kernel interpolation, and structure exploiting algebra. The key idea of our method is to use Tensor Train decomposition for variational parameters, which allows us to train GPs with billions of inducing inputs and achieve state-of-the-art results on several benchmarks. Further, our approach allows for training kernels based on deep neural networks without any modifications to the underlying GP model. A neural network learns a multidimensional embedding for the data, which is used by the GP to make the final prediction. We train GP and neural network parameters end-to-end without pretraining, through maximization of GP marginal likelihood. We show the efficiency of the proposed approach on several regression and classification benchmark datasets including MNIST, CIFAR-10, and Airline.

研究动机与目标

  • 克服现有高斯过程方法在诱导输入数量上限于10^4的可扩展性限制。
  • 实现在大规模、高维数据集上的高效高斯过程训练,包括基于深度神经网络核的方法。
  • 开发一种变分推断框架,在通过紧凑张量分解显著降低内存和计算成本的同时保持预测准确性。
  • 在不修改高斯过程模型架构的前提下,支持深度核高斯过程的端到端训练。
  • 在大规模数据集上实现可扩展的不确定性估计和结构化预测,利用深度核高斯过程。

提出的方法

  • 该方法使用张量列车(TT)分解来参数化诱导点函数值变分分布的均值向量,实现高维向量的紧凑表示。
  • 采用克罗内克积结构表示诱导变量的协方差矩阵,降低存储和计算成本。
  • 通过随机梯度下降优化变分推断过程,实现在大规模数据集上的可扩展训练。
  • 通过使用深度神经网络的输出作为高斯过程的输入,支持深度核学习,且无需修改高斯过程模型。
  • TT-GP在特征空间中构建诱导输入的规则网格,并使用低秩张量格式推断该网格上的高斯过程后验分布。
  • 通过TT-秩控制模型复杂度和泛化能力,秩的选择通过交叉验证或启发式初始化完成。

实验结果

研究问题

  • RQ1高斯过程模型能否在保持预测准确性的同时扩展至使用数十亿个诱导输入?
  • RQ2张量列车分解能否有效参数化高斯过程推断中的变分分布,以减少内存和计算成本?
  • RQ3将TT格式用于均值向量并与协方差矩阵的克罗内克结构结合,能否实现与特征空间维度的线性缩放?
  • RQ4TT-GP能否在不修改高斯过程模型架构的前提下,从原始数据中有效学习深度核函数?
  • RQ5在高维数据集上,TT-GP与KISS-GP和SV-DKL等现有方法相比,在准确性和训练效率方面表现如何?

主要发现

  • TT-GP在Airline数据集上达到最先进性能,使用600万条训练样本时分类准确率达到0.788±0.002。
  • 在CIFAR-10上,TT-GP使用9维嵌入的深度核达到0.908±0.003的准确率,优于独立的深度神经网络,并与或超过SV-DKL结果。
  • 在MNIST上,TT-GP使用10维嵌入达到0.9936±0.0004的准确率,性能与独立深度神经网络相当,但具备完整的高斯过程不确定性量化能力。
  • 该方法训练效率高,在Tesla K80 GPU上,MNIST每轮仅需64秒,CIFAR-10每轮仅需220秒。
  • TT-GP成功学习了深度神经网络嵌入的非线性变换,将同类别样本在嵌入空间中聚集成紧凑区域。
  • 该方法可扩展至数十亿个诱导输入,实现在大规模、高维数据集上高保真度的高斯过程近似,而此前方法在这些场景下均告失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。