[论文解读] Scalable Gaussian Process Classification via Expectation Propagation
本文提出可扩展期望传播(SEP),一种用于大规模高斯过程分类的新方法,通过可处理的数据汇总边缘似然估计实现分布式训练和超参数的随机优化。SEP在性能上与最先进变分推断方法相当,同时避免了单变量求积,并由于更精确的后验近似而实现更快的初始收敛速度。
Variational methods have been recently considered for scaling the training process of Gaussian process classifiers to large datasets. As an alternative, we describe here how to train these classifiers efficiently using expectation propagation. The proposed method allows for handling datasets with millions of data instances. More precisely, it can be used for (i) training in a distributed fashion where the data instances are sent to different nodes in which the required computations are carried out, and for (ii) maximizing an estimate of the marginal likelihood using a stochastic approximation of the gradient. Several experiments indicate that the method described is competitive with the variational approach.
研究动机与目标
- 为解决标准高斯过程分类在大规模数据集上因O(n³)复杂度导致的计算不可行性。
- 通过分布式计算和随机优化技术,实现高斯过程分类器的可扩展训练。
- 开发一种支持诱导点与超参数联合优化的方法,且无需依赖单变量求积。
- 提供一种可处理、可扩展的变分推断替代方案,具有更优的早期收敛性能。
- 在包含MNIST和美国航空延误数据集在内的数百万实例数据集上,展示具有竞争力的性能。
提出的方法
- 使用期望传播(EP)近似高斯过程分类中难以处理的后验分布。
- 采用m ≪ n个诱导点的稀疏近似,将计算成本降低至O(nm²)。
- 推导出一种边缘似然估计,其表达为对数据实例的求和,从而支持随机梯度优化。
- 通过将数据分割到多个计算节点上,实现分布式训练,每个节点处理部分实例。
- 通过在边缘似然估计上使用随机梯度上升法,联合优化后验近似和模型超参数。
- 使用Adadelta优化器,ρ=0.9且ε=10⁻⁵进行超参数更新,小批量大小等于诱导点数量(m=200)。
实验结果
研究问题
- RQ1期望传播能否被调整以实现在大规模数据集上高斯过程分类器的可扩展训练?
- RQ2所提出的方法是否支持分布式训练和超参数的随机优化?
- RQ3在预测准确率和训练速度方面,该方法与变分推断和广义FITC相比表现如何?
- RQ4基于EP的后验近似是否能带来优于基于梯度的变分推断的早期收敛性能?
- RQ5该方法能否处理数百万实例的数据集,其中批量方法不可行?
主要发现
- 所提出的SEP方法在大规模数据集(如MNIST和美国航空延误数据集)上实现了与最先进变分推断(SVI)相当的预测性能。
- 在GFITC因计算不可行而失效的大规模数据集上,SEP表现优于广义FITC(GFITC)。
- SEP和SVI的随机变体收敛迅速,SEP甚至在批量方法完成第一次超参数更新前即达到良好性能。
- SEP的初始性能优于SVI,可能归因于EP更新相比SVI中基于梯度的更新能提供更精确的后验近似。
- 在包含210万实例的航空延误数据集上,SEP和SVI均优于线性逻辑回归,证实了该问题的非线性特性。
- 当使用小批量时,SEP的计算成本为O(m³),内存需求为O(nm),适用于大规模应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。