[论文解读] Sparse Orthogonal Variational Inference for Gaussian Processes
该论文提出了一种新型框架——稀疏正交变分推断(SOLVE-GP),通过诱导点将高斯过程分解为低秩分量与正交全秩残差过程,实现了更高效且灵活的推断。通过为正交分量引入第二组诱导变量,SOLVE-GP获得了更紧致的变分下界,并在仅使用384+384个诱导点每层的情况下,实现了基于纯高斯过程模型在CIFAR-10上的最先进性能,准确率达到80.30%。
We introduce a new interpretation of sparse variational approximations for Gaussian processes using inducing points, which can lead to more scalable algorithms than previous methods. It is based on decomposing a Gaussian process as a sum of two independent processes: one spanned by a finite basis of inducing points and the other capturing the remaining variation. We show that this formulation recovers existing approximations and at the same time allows to obtain tighter lower bounds on the marginal likelihood and new stochastic variational inference algorithms. We demonstrate the efficiency of these algorithms in several Gaussian process models ranging from standard regression to multi-class classification using (deep) convolutional Gaussian processes and report state-of-the-art results on CIFAR-10 among purely GP-based models.
研究动机与目标
- 解决稀疏变分高斯过程的计算瓶颈问题,其计算复杂度随诱导点数量呈立方增长。
- 克服现有方法在不带来高昂成本的前提下灵活增加诱导点数量的局限性。
- 通过将高斯过程先验结构化地分解为两个独立分量,提升变分推断的质量。
- 通过双诱导点公式化方法,实现对边缘似然更高效且更紧致的下界估计。
- 在无需神经网络组件的情况下,实现大规模视觉基准(如CIFAR-10)上基于高斯过程模型的最先进性能。
提出的方法
- 将高斯过程先验分解为两个独立过程:由诱导点张成的低秩分量,以及与之正交的全秩残差过程。
- 引入第二组诱导变量 $\mathbf{v}_\perp$,以总结正交残差过程,从而实现高效推断。
- 将标准SVGP重新诠释为该分解的一个特例,为现有稀疏高斯过程方法提供了统一视角。
- 在两组诱导点集合的并集上构建结构化的协方差近似,以实现更紧致的变分下界。
- 开发一种基于子采样的随机变分推断算法,结合高效的Cholesky更新机制,将每次迭代中 $M_2$ 的计算成本从 $O(M_2^3)$ 降低至 $O(M_2)$。
- 采用白化技巧以提升优化稳定性,尤其在基线SVGP中处理大规模协方差矩阵时效果显著。
实验结果
研究问题
- RQ1将高斯过程先验分解为正交分量是否能提升稀疏变分推断的可扩展性与灵活性?
- RQ2为正交残差过程引入第二组诱导变量是否能带来更紧致的边缘似然下界?
- RQ3该框架是否能实现有效诱导点数量的显著增加,而不会导致计算成本的相应立方增长?
- RQ4在回归与分类基准上,SOLVE-GP相较于标准SVGP和ODVGP在预测准确率与训练效率方面表现如何?
- RQ5基于纯高斯过程的模型是否能在不使用任何神经网络组件的前提下,实现在CIFAR-10上的最先进性能?
主要发现
- SOLVE-GP在仅使用每层384+384个诱导点的三层次深度卷积高斯过程下,于CIFAR-10上实现了80.30%的测试准确率,优于以往所有纯高斯过程模型。
- 在相同计算预算下,SOLVE-GP使用 $M=768, 768, 2K$ 个诱导点的性能优于SVGP使用 $M=1536, 1536, 2K$ 个诱导点的测试准确率与对数似然。
- SOLVE-GP在仅需一半Cholesky分解成本的前提下,实现了与使用 $M=2048$ 个诱导点的SVGP相当的性能。
- 在回归基准上,SOLVE-GP优于使用 $M_2=8096$ 个诱导点的ODVGP,表明变分分布中灵活的协方差建模比单纯增加诱导点数量更为关键。
- 白化技巧使使用 $M=2048$ 个诱导点的SVGP性能接近SOLVE-GP,表明大协方差矩阵带来的优化困难限制了SVGP的有效性。
- 与标准SVGP相比,该方法在Cholesky计算成本仅增加两倍的情况下,实现了诱导点数量的两倍增长,而标准SVGP则需八倍成本,充分体现了其卓越的可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。