[论文解读] Sparse Gaussian Processes Revisited: Bayesian Approaches to Inducing-Variable Approximations
本文挑战了变分稀疏高斯过程中优化诱导输入的常规做法,提出采用随机梯度哈密顿蒙特卡洛(SG-HMC)对诱导输入和超参数进行完全贝叶斯处理。通过结合先进的采样方法重新审视完全独立训练条件(FITC)近似,该方法在回归和分类基准上实现了最先进性能,显著提升了不确定性量化和预测准确性,优于使用点估计的标准变分推断。
Variational inference techniques based on inducing variables provide an elegant framework for scalable posterior estimation in Gaussian process (GP) models. Besides enabling scalability, one of their main advantages over sparse approximations using direct marginal likelihood maximization is that they provide a robust alternative for point estimation of the inducing inputs, i.e. the location of the inducing variables. In this work we challenge the common wisdom that optimizing the inducing inputs in the variational framework yields optimal performance. We show that, by revisiting old model approximations such as the fully-independent training conditionals endowed with powerful sampling-based inference methods, treating both inducing locations and GP hyper-parameters in a Bayesian way can improve performance significantly. Based on stochastic gradient Hamiltonian Monte Carlo, we develop a fully Bayesian approach to scalable GP and deep GP models, and demonstrate its state-of-the-art performance through an extensive experimental campaign across several regression and classification problems.
研究动机与目标
- 挑战变分稀疏高斯过程中优化诱导输入的常见做法,该做法将诱导输入视为固定变分参数而非随机变量。
- 探究对诱导输入和GP超参数进行完全贝叶斯处理是否能优于点估计方法。
- 开发一种可扩展的基于采样的推理框架,实现在大规模GP和深度GP模型中对高维诱导输入进行后验推断。
- 证明通过现代贝叶斯采样技术重新审视如FITC等旧近似方法可带来显著性能提升。
- 提供一种有原则的替代方案,以取代标准变分推断框架中将诱导输入视为确定性可优化参数的做法。
提出的方法
- 提出一种稀疏高斯过程的完全贝叶斯推理框架,其中诱导输入和超参数均赋予先验,并通过随机梯度哈密顿蒙特卡洛(SG-HMC)进行采样。
- 采用完全独立训练条件(FITC)近似作为基础GP近似方法,实现在保持建模灵活性的同时实现高效计算。
- 将随机梯度马尔可夫链蒙特卡洛(SG-MCMC)与变分推断相结合,实现大规模数据集上的后验采样,利用小批量梯度提升效率。
- 将诱导输入视为具有先验分布的随机变量,从而实现对其位置的完整后验推断,而非点估计。
- 采用联合后验推断方案,同时从诱导变量和GP超参数的后验分布中采样,避免了单独优化步骤。
- 使用重参数化技巧和高效的核近似方法,在保持计算可扩展性的同时实现对诱导输入的完整贝叶斯处理。
实验结果
研究问题
- RQ1在变分框架中优化诱导输入是否真能实现最优性能,还是对这些输入进行完全贝叶斯处理更为优越?
- RQ2能否通过现代基于采样的推理方法使旧的GP近似(如FITC)焕发新生,从而实现最先进性能?
- RQ3在大规模GP模型中对高维诱导输入进行完整贝叶斯推断是否可行且有益?
- RQ4与使用诱导输入点估计的标准变分推断相比,完全贝叶斯方法在多样化回归和分类任务中的表现如何?
- RQ5将诱导输入和超参数均视为随机变量,对不确定性量化和预测准确性有何影响?
主要发现
- 所提出的SG-HMC完全贝叶斯方法在所有基准数据集上均优于使用优化诱导输入的标准变分推断,在回归和分类任务中均实现了最先进性能。
- 该方法显著改善了预测不确定性校准,表现为更低的负对数预测密度(NLPD)以及更优的概率预测覆盖率。
- 在波士顿房价数据集上,贝叶斯稀疏GP(bsgp)的归一化RMSE为0.36(±0.07),在准确性和不确定性估计方面均优于SVG-P(0.33)及其他基线方法。
- 在蛋白质数据集上,bsgp的归一化RMSE为0.65(±0.01),相比IPVI-GP(0.65)和SGLD-GP(0.69)展现出更优的泛化能力与更好的不确定性校准。
- 在海军数据集上,所有五次运行中,该方法均持续实现更低的测试误差和NLPD,bsgp的测试误差为0.01(±0.00),NLPD为-6.55(±0.09),优于SVG-P和SGLD-GP。
- 结果表明,将诱导输入视为具有先验的随机变量并进行后验采样,可实现比点估计更稳健可靠的预测,即使在含数千个诱导点的高维设置下亦是如此。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。