Skip to main content
QUICK REVIEW

[论文解读] Scalable Training of Inference Networks for Gaussian-Process Models

Jiaxin Shi, Mohammad Emtiyaz Khan|arXiv (Cornell University)|May 27, 2019
Gaussian Processes and Bayesian Inference参考文献 53被引用 4
一句话总结

该论文提出了一种可扩展的、支持小批量训练的高斯过程模型推理网络,采用随机函数镜像下降算法,在函数空间中追踪贝叶斯滤波器。该方法通过高效保持跨数据批次的输出相关性,避免了诱导点的限制,实现了灵活且高容量的后验近似——在回归和分类任务中性能优于稀疏变分高斯过程方法。

ABSTRACT

Inference in Gaussian process (GP) models is computationally challenging for large data, and often difficult to approximate with a small number of inducing points. We explore an alternative approximation that employs stochastic inference networks for a flexible inference. Unfortunately, for such networks, minibatch training is difficult to be able to learn meaningful correlations over function outputs for a large dataset. We propose an algorithm that enables such training by tracking a stochastic, functional mirror-descent algorithm. At each iteration, this only requires considering a finite number of input locations, resulting in a scalable and easy-to-implement algorithm. Empirical results show comparable and, sometimes, superior performance to existing sparse variational GP methods.

研究动机与目标

  • 为解决在小批量设置下训练灵活推理网络以拟合高斯过程模型的挑战,其中保持函数空间相关性较为困难。
  • 克服稀疏变分高斯过程方法的局限性,后者依赖少量诱导点,通常在大规模数据集上表现欠拟合。
  • 通过随机梯度实现深度神经网络作为高斯过程模型后验近似器的可扩展、稳定且高性能训练。
  • 为基于诱导点的高斯过程推理提供更具灵活性的替代方案,支持复杂且结构化的核函数(如深度神经网络所生成的核函数)。

提出的方法

  • 该方法使用随机函数镜像下降算法,在函数空间中追踪一个计算上不可行但可作为近似目标的贝叶斯滤波器。
  • 在每个训练步骤中,算法利用小批量数据计算随机梯度,以更新推理网络,确保函数输出之间保持有意义的相关性。
  • 推理网络通过从其当前近似中进行自举(bootstrapping)进行训练,实现无需完整数据遍历的迭代优化。
  • 该方法支持多种网络架构,包括随机特征展开和深度卷积网络(ConvNets),并兼容非共轭似然函数(如用于分类的Softmax)。
  • 该方法在教师-学生框架中进行解释,其中‘教师’是由当前网络导出的镜像下降更新,从而实现高效且可扩展的训练。
  • 该方法成功实现了在无限宽贝叶斯卷积神经网络中训练深度卷积网络作为高斯过程推理网络,克服了标准SVGP在这些核函数上常见的数值不稳定性问题。

实验结果

研究问题

  • RQ1我们能否在使用小批量随机梯度训练的同时,保持函数输出之间的有意义相关性,从而训练灵活的高斯过程模型推理网络?
  • RQ2基于函数镜像下降的训练算法是否在预测准确性和泛化能力方面优于现有的稀疏变分高斯过程方法?
  • RQ3所提出的方法是否能够扩展至复杂且结构化的核函数(如深度神经网络生成的核函数),尤其是在分类任务中?
  • RQ4是否可以不依赖诱导点训练深度卷积网络作为高斯过程模型的推理网络,且是否能带来更好的性能?

主要发现

  • 在Bikes和Kegg数据集上,GPNet在所有方法中取得了最低的RMSE,当使用少量诱导点时,其与SVGP的性能差距显著。
  • SVGP在M=100与M=500之间的RMSE差距大于GPNet,表明GPNet的性能不受诱导点数量的限制。
  • 在MNIST和CIFAR10数据集上,GPNet分别实现了1.12%和24.63%的测试错误率,优于SVGP及其他稀疏GP基线方法,且使用了灵活的深度卷积神经网络推理网络。
  • 该方法成功训练了一个深度卷积网络用于CNN-GP先验,在分类任务中取得了最先进性能,尽管标准SVGP在这些核函数上通常存在数值不稳定性问题。
  • 该方法避免了以往小批量训练推理网络中常见的过拟合与欠拟合问题,尤其在FBNN模型中,随着M增大性能并未下降。
  • 实证结果表明,GPNet为稀疏GP方法提供了更具灵活性和可扩展性的替代方案,尤其适用于复杂结构化核函数和高维数据。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。