[论文解读] Generic Inference in Latent Gaussian Process Models
本文提出了一种通用且可扩展的变分推断方法,用于具有任意似然函数的潜在高斯过程模型,采用高斯混合模型作为变分后验,并通过一维采样实现高效的蒙特卡洛估计。该方法在大规模回归与分类任务中实现了最先进性能,且无需进行特定于模型的推导。
We develop an automated variational method for inference in models with Gaussian process (GP) priors and general likelihoods. The method supports multiple outputs and multiple latent functions and does not require detailed knowledge of the conditional likelihood, only needing its evaluation as a black-box function. Using a mixture of Gaussians as the variational distribution, we show that the evidence lower bound and its gradients can be estimated efficiently using samples from univariate Gaussian distributions. Furthermore, the method is scalable to large datasets which is achieved by using an augmented prior via the inducing-variable approach underpinning most sparse GP approximations, along with parallel computation and stochastic optimization. We evaluate our approach quantitatively and qualitatively with experiments on small datasets, medium-scale datasets and large datasets, showing its competitiveness under different likelihood models and sparsity levels. On the large-scale experiments involving prediction of airline delays and classification of handwritten digits, we show that our method is on par with the state-of-the-art hard-coded approaches for scalable GP regression and classification.
研究动机与目标
- 开发一种完全自动化的高斯过程模型推断方法,适用于通用非线性似然函数,避免手动推导变分界限。
- 通过结合稀疏GP近似与随机优化及并行计算,解决大规模数据集中的可扩展性问题。
- 通过在观测值与函数间采用因子化先验与似然函数,支持多输出与多潜变量函数模型。
- 实现对似然函数的黑箱评估,无需解析梯度或闭式表达式。
- 减轻在多样化概率模型中进行自定义变分推断推导的工作负担。
提出的方法
- 使用高斯混合模型作为诱导变量上的变分后验,以灵活逼近复杂后验分布。
- 通过从一维高斯分布中采样,采用蒙特卡洛估计证据下界(ELBO),从而实现高效的梯度计算。
- 应用诱导变量近似(稀疏GP框架)通过引入一组精简的诱导输入,实现大规模数据集的可扩展性。
- 利用随机优化与并行计算进一步提升可扩展性与训练效率。
- 通过在观测值与函数间采用因子化先验与似然函数,支持具有多个潜变量函数与输出的模型。
- 将似然函数视为黑箱,仅需评估,无需解析形式或梯度计算。
实验结果
研究问题
- RQ1能否为潜在高斯过程模型开发一种通用的变分推断框架,支持任意似然函数且无需特定于模型的推导?
- RQ2通过一维采样进行蒙特卡洛估计,在复杂GP模型中对ELBO及其梯度的近似效果如何?
- RQ3所提出方法在保持预测准确性与不确定性校准的前提下,对大规模数据集的可扩展性如何?
- RQ4在回归与分类任务中,该通用方法与硬编码的最先进方法相比性能如何?
- RQ5在不同数据集中,学习诱导输入位置与固定位置相比对模型性能的影响如何?
主要发现
- 在大规模回归(航班延误)与分类(MNIST)任务中,该方法性能与最先进硬编码方法相当。
- 在MNIST数据集上,尽管诱导变量数量减少了十倍,但学习诱导输入位置仍带来了与更密集模型相当的性能提升。
- 在Sarcos数据集上,使用完整GP回归网络(GPRN)模型学习全部七个关节,即使点预测(MSE)略有下降,但不确定性估计(更低的NLPD)得到改善。
- Sarcos实验需要10,000次蒙特卡洛采样才能获得稳定结果,表明涉及潜变量过程乘积的复杂似然函数具有更高的方差。
- 该方法在不同稀疏程度与似然模型下表现出稳健性,当诱导输入被优化时始终带来一致的性能提升。
- 使用高斯混合模型作为变分后验,即使在高维多输出场景下,也能实现准确的后验近似。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。