Skip to main content
QUICK REVIEW

[论文解读] Deep Gaussian Processes with Decoupled Inducing Inputs

Marton Havasi, José Miguel Hernández-Lobato|arXiv (Cornell University)|Jan 9, 2018
Gaussian Processes and Bayesian Inference参考文献 3被引用 3
一句话总结

本文在深度高斯过程(DGPs)中引入了解耦的诱导输入,通过为均值和方差计算分别使用独立的诱导点集,实现了更快的训练速度和更优的预测性能,同时保持了不确定性校准能力。

ABSTRACT

Deep Gaussian Processes (DGP) are hierarchical generalizations of Gaussian Processes (GP) that have proven to work effectively on a multiple supervised regression tasks. They combine the well calibrated uncertainty estimates of GPs with the great flexibility of multilayer models. In DGPs, given the inputs, the outputs of the layers are Gaussian distributions parameterized by their means and covariances. These layers are realized as Sparse GPs where the training data is approximated using a small set of pseudo points. In this work, we show that the computational cost of DGPs can be reduced with no loss in performance by using a separate, smaller set of pseudo points when calculating the layerwise variance while using a larger set of pseudo points when calculating the layerwise mean. This enabled us to train larger models that have lower cost and better predictive performance.

研究动机与目标

  • 降低深度高斯过程(DGPs)训练的计算成本,同时不损害预测性能。
  • 探究是否可将此前在标准高斯过程(GPs)中证明有效的均值与方差计算中诱导输入的解耦方法,扩展至深度高斯过程设置。
  • 通过允许使用更低计算开销的更大DGP架构,提升模型可扩展性。
  • 评估解耦方法是否相比标准DGP在泛化能力和不确定性估计方面表现更优。
  • 通过改进参数化方式,解决诱导点优化中的梯度消失问题。

提出的方法

  • 将解耦高斯过程框架(Cheng & Boots, 2017)适配至DGPs,采用两组独立的诱导输入:$\bm{Z}_a$ 用于均值计算,$\bm{Z}_b$ 用于方差计算。
  • 用双参数化替代标准GP的均值与协方差计算:$\tilde{\mu} = \bm{K}_{\bm{X}\bm{Z}_a}\bm{a}$ 和 $\tilde{\Sigma} = \bm{K}_{\bm{X}\bm{X}} - \bm{K}_{\bm{X}\bm{Z}_b}(\bm{B}^{-1} + \bm{K}_{\bm{Z}_b\bm{Z}_b})^{-1}\bm{K}_{\bm{X}\bm{Z}_b}^T$。
  • 在DGPs中保持变分推断框架,ELBO被调整以考虑每一层中独立的诱导输入集。
  • 使用Cholesky分解对$\bm{S}$和$\bm{B}$进行处理,以在优化过程中确保数值稳定性。
  • 采用随机梯度下降(Adam)方法,使用小批量数据,固定学习率为0.01,训练5000个周期。
  • 在每一层应用静态均值函数以稳定训练过程,避免协方差矩阵退化。

实验结果

研究问题

  • RQ1能否成功将均值与方差计算中诱导输入的解耦方法扩展至深度高斯过程?
  • RQ2在计算成本相当的前提下,解耦DGP是否相比标准DGP具有更优的预测性能?
  • RQ3解耦DGP是否在计算效率上更具优势,尤其是在更深的网络架构中?
  • RQ4为均值($M_a$)和方差($M_b$)选择不同大小的诱导点集,如何影响模型性能与训练时间?
  • RQ5解耦方法是否能缓解DGP优化中的梯度消失问题?

主要发现

  • 在kin8nm、protein和molecules三个数据集上,解耦DGP的测试对数似然均高于标准DGP。
  • 在除kin8nm上的两层模型外,所有数据集上解耦DGP的测试均方根误差(RMSE)均低于标准DGP。
  • 对于至少包含一个隐藏层的模型,解耦DGP训练速度更快,其中在molecules数据集上,中位运行时间最多减少30%。
  • 在深层模型中(如molecules数据集上$L=4$),当$M_a = 500$、$M_b = 100$时,解耦模型的运行时间显著低于标准DGP($M = 200$)(分别为1017秒 vs. 1601秒)。
  • 性能增益在深层架构中最为显著,因为减少$M_b$带来的计算节省效果最明显。
  • 解耦方法实现了$O\big{(}L(DNM_a + M_a^3 + DNM_b^2 + M_b^3)\big{)}$的复杂度界,对于大批次大小而言已接近理论最优值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。