Skip to main content
QUICK REVIEW

[论文解读] Deep Gaussian Processes with Importance-Weighted Variational Inference

Hugh Salimbeni, Vincent Dutordoir|arXiv (Cornell University)|May 14, 2019
Gaussian Processes and Bayesian Inference被引用 20
一句话总结

本文提出了一种新颖的重要加权变分推断方法,用于深度高斯过程(DGPs),通过引入独立的潜变量作为协变量而非加性噪声,来建模非高斯边缘分布。通过结合用于相关高斯过程的稀疏变分推断与用于不相关潜变量的重要加权估计,该方法提升了后验近似精度,尤其在深层模型中表现更优,在多种一维密度估计任务中优于标准变分推断。

ABSTRACT

Deep Gaussian processes (DGPs) can model complex marginal densities as well as complex mappings. Non-Gaussian marginals are essential for modelling real-world data, and can be generated from the DGP by incorporating uncorrelated variables to the model. Previous work on DGP models has introduced noise additively and used variational inference with a combination of sparse Gaussian processes and mean-field Gaussians for the approximate posterior. Additive noise attenuates the signal, and the Gaussian form of variational distribution may lead to an inaccurate posterior. We instead incorporate noisy variables as latent covariates, and propose a novel importance-weighted objective, which leverages analytic results and provides a mechanism to trade off computation for improved accuracy. Our results demonstrate that the importance-weighted objective works well in practice and consistently outperforms classical variational inference, especially for deeper models.

研究动机与目标

  • 为解决深度高斯过程中加性噪声的局限性,其会削弱信号并限制对非高斯数据边缘分布的建模。
  • 通过用重要加权方案替代潜变量的平均场高斯近似,提升深度高斯过程中的后验近似精度。
  • 通过将独立潜变量视为协变量而非噪声,实现对复杂非高斯数据分布的更好建模。
  • 开发一种可扩展的推断框架,通过增加计算量换取更高的精度,同时保持高斯过程部分的解析可处理性。
  • 通过实证验证,发现具有潜协变量和重要加权推断的深层DGP模型在各种一维密度估计任务中始终优于经典变分推断和无噪声基线模型。

提出的方法

  • 使用两层结构建模深度高斯过程:一层为用于相关潜函数的高斯过程层,另一层为通过拼接引入的、不相关且独立同分布的潜变量(LV)层作为输入。
  • 应用带诱导点的稀疏变分推断以近似高斯过程函数的后验分布,确保计算效率和解析可处理性。
  • 对潜变量使用平均场高斯近似,这些潜变量在数据点之间被视为独立,并作为额外输入整合到高斯过程中。
  • 提出一种新颖的重要加权变分推断目标,通过重新加权潜变量后验分布的样本,提升后验近似精度。
  • 将重要加权方案与部分坍缩变分推断相结合,实现更优的梯度估计和更优的后验近似,同时不损失高斯过程项的解析结果。
  • 采用双重重参数化梯度估计器,以缓解重要加权目标中的梯度方差问题,提升训练稳定性。

实验结果

研究问题

  • RQ1通过将独立潜变量视为协变量而非加性噪声,能否改善深度高斯过程中非高斯数据边缘分布的建模?
  • RQ2在深度高斯过程模型中,重要加权变分推断方案是否能持续优于标准平均场变分推断?
  • RQ3所提出的具有潜协变量和重要加权的DGP模型在各种一维密度估计任务中,与无噪声DGP模型和经典变分推断相比,性能如何?
  • RQ4重要加权方法在多大程度上提升了后验近似精度,特别是在更深层的网络架构中?
  • RQ5该方法能否有效建模复杂、多峰且非光滑的数据分布,而这些分布通常难以被标准高斯过程模型捕捉?

主要发现

  • 所提出的具有潜协变量和重要加权推断的DGP模型在一系列一维密度估计任务中,始终优于经典变分推断和无噪声DGP基线模型,尤其在深层架构中表现更优。
  • 非高斯边缘分布(如多峰和分段常数分布)成功被模型捕捉,如在合成数据集'glyph' DGP数据集上的展示。
  • 重要加权目标在所有测试数据集中均提升了预测似然和后验近似精度,且增益随模型深度增加而提升。
  • 通过核方差超参数实现层的“关闭”能力,确保深层模型不会降低性能;当潜变量层的长度尺度设为较大值时,该层可被禁用。
  • 该方法在小样本和中等样本数据设置中表现出鲁棒性,而诸如条件VAE等未正则化的模型在此类设置中容易过拟合,而所提出的具有潜变量的DGP则泛化良好。
  • 尽管缺乏预测密度的闭式解,模型通过蒙特卡洛采样实现了高质量的后验估计,重要加权有效降低了方差并提升了收敛性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。