[论文解读] Scalable Variational Gaussian Process Regression Networks
本文提出了一种可扩展的变分推断算法用于高斯过程回归网络(GPRN),通过使用张量正态和矩阵正态的变分后验分布,捕捉潜在函数与输出之间复杂的后验依赖关系。通过输出空间的张量化以及在证据下界中利用克罗内克(Kronecker)结构,该方法在数据量、输出维度和潜在函数数量上均实现线性缩放,显著提升了大规模多输出回归任务中的推断质量与计算效率,包括在物理模拟中对百万维输出的预测。
Gaussian process regression networks (GPRN) are powerful Bayesian models for multi-output regression, but their inference is intractable. To address this issue, existing methods use a fully factorized structure (or a mixture of such structures) over all the outputs and latent functions for posterior approximation, which, however, can miss the strong posterior dependencies among the latent variables and hurt the inference quality. In addition, the updates of the variational parameters are inefficient and can be prohibitively expensive for a large number of outputs. To overcome these limitations, we propose a scalable variational inference algorithm for GPRN, which not only captures the abundant posterior dependencies but also is much more efficient for massive outputs. We tensorize the output space and introduce tensor/matrix-normal variational posteriors to capture the posterior correlations and to reduce the parameters. We jointly optimize all the parameters and exploit the inherent Kronecker product structure in the variational model evidence lower bound to accelerate the computation. We demonstrate the advantages of our method in several real-world applications.
研究动机与目标
- 为解决现有GPRN推断方法的局限性,这些方法使用完全因子化的变分后验分布,忽略了潜在变量与权重之间强烈的后验依赖关系。
- 降低GPRN中变分推断的计算成本,特别是在输出维度D较大时,现有方法的复杂度为O(NK²D)或O(QN²KD),扩展性差。
- 开发一种可扩展且高效的推断算法,联合优化所有变分参数,同时捕捉潜在函数与投影权重中的丰富后验相关性。
- 使GPRN能够实际应用于真实世界的大规模多输出回归问题,如MRI预测和具有数百万输出的物理模拟。
提出的方法
- 通过将D×K的投影矩阵重排为张量,对输出空间进行张量化,以利用输出中的结构相关性。
- 引入张量正态分布作为投影权重的联合变分后验分布,以捕捉后验依赖关系,同时将协方差参数数量从O(D²)减少到O(D),在张量格式下实现。
- 使用矩阵正态分布作为潜在函数值的变分后验分布,以高效建模其联合后验依赖关系。
- 将变分证据下界(ELBO)表述为可利用克罗内克积性质进行分解的形式,以加速对数行列式与矩阵求逆的计算。
- 使用基于梯度的优化方法联合优化所有变分参数,避免低效的交替更新。
- 利用黑塞矩阵与费雪信息矩阵近似中的克罗内克结构,实现O(NKD)的时间复杂度,与N、D和K均呈线性关系。
实验结果
研究问题
- RQ1与完全因子化近似相比,该GPRN变分推断方法能否更有效地捕捉潜在函数与投影权重之间的后验依赖关系?
- RQ2GPRN推断的计算复杂度能否降低至与输出数量D呈线性关系,尤其是在D达到数百万时?
- RQ3在大规模多输出回归任务中,该方法是否在实现显著加速的同时仍保持高预测精度?
- RQ4该方法能否有效应用于真实世界中输出维度极高的问题,如具有百万个输出变量的物理模拟?
主要发现
- 在三个基准数据集(Jura、Equity、PM2.5)上,所提出的SGPRN方法在平均绝对误差(MAE)上显著低于均场变分贝叶斯(MFVB)和非参数变分推断(NPV),p值<0.05,证明其预测性能更优。
- 在PM2.5数据集上使用50个潜在函数时,SGPRN相比MFVB实现了200倍的加速,相比NPV实现了785倍的加速,验证了其O(NKD)的线性复杂度与可扩展性。
- 在Cantilever和GeneExp数据集上,SGPRN在归一化均方根误差(NRMSE)上始终优于PCA-GP、KPCA-GP和IsoMAP-GP,仅在一种情况下略逊于PCA-PG,表明其在结构化输出相关性上具有强大的泛化能力。
- 在具有百万维输出维度的大规模物理模拟(lid-driven cavity flows)中,SGPRN在NRMSE上显著优于所有基线方法,尤其在使用5个和10个潜在函数时,证明了其在极端规模应用中的有效性。
- 该方法在不同张量化方案和不同数量的潜在函数下表现稳健,且在准确率与效率上均保持一致的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。