[论文解读] State Space Gaussian Processes with Non-Gaussian Likelihood
该论文提出了一种统一且高效的高斯过程推理框架,适用于非高斯似然,采用状态空间方法,实现 O(n) 时间和内存复杂度。该方法将拉普拉斯近似、变分贝叶斯和期望传播扩展至状态空间设置,并通过卷积插值加速矩阵指数计算,在保持高精度的同时显著提升了大规模时间序列数据集的推理速度。
We provide a comprehensive overview and tooling for GP modeling with non-Gaussian likelihoods using state space methods. The state space formulation allows for solving one-dimensional GP models in $\mathcal{O}(n)$ time and memory complexity. While existing literature has focused on the connection between GP regression and state space methods, the computational primitives allowing for inference using general likelihoods in combination with the Laplace approximation (LA), variational Bayes (VB), and assumed density filtering (ADF, a.k.a. single-sweep expectation propagation, EP) schemes has been largely overlooked. We present means of combining the efficient $\mathcal{O}(n)$ state space methodology with existing inference methods. We extend existing methods, and provide unifying code implementing all approaches.
研究动机与目标
- 解决高斯过程模型中非高斯似然带来的计算瓶颈,此类问题通常需要昂贵的近似方法。
- 通过利用高斯过程的状态空间表示,降低复杂度至 O(n),实现大规模时间序列数据集的可扩展推理。
- 在单一状态空间框架内统一并高效实现多种近似推理方法——拉普拉斯近似、变分贝叶斯、期望传播和 KL 散度最小化。
- 克服由于不均匀采样数据中昂贵的矩阵指数计算导致的 O(n) 复杂度中的高常数因子。
- 在 GPML 工具箱中提供参考实现,以支持可复现性和实际应用。
提出的方法
- 使用马氏协方差函数将高斯过程表示为连续时间状态空间模型,实现精确的卡尔曼滤波与平滑。
- 基于卡尔曼滤波和动力系统理论,开发用于近似推理的计算原语,包括预测、滤波和平滑。
- 通过将状态后验的递归更新形式化,将标准推理方法(拉普拉斯、VB、ADF/EP、KL)扩展至状态空间设置。
- 引入卷积插值以近似矩阵指数,降低每时间步的计算成本,从而加速推理。
- 通过反向传播通过卡尔曼滤波递推过程,实现所有推理方法的基于梯度的超参数学习。
- 实现统一的代码库,支持所有推理方法和似然类型,并集成至 GPML 工具箱 v4.2。
实验结果
研究问题
- RQ1状态空间方法能否被扩展以支持高斯过程模型中的非高斯似然,同时保持 O(n) 复杂度?
- RQ2标准近似推理方法(如拉普拉斯近似、变分贝叶斯和期望传播)如何在状态空间框架中实现统一且高效的集成?
- RQ3矩阵指数计算对 O(n) 复杂度中的常数因子有何影响?如何降低该影响?
- RQ4基于插值的矩阵指数加速方法对真实世界时间序列数据的推理速度和精度有何影响?
- RQ5所提出的统一框架在大规模时间序列数据集上与密集高斯过程推理相比,能否实现具有竞争力的预测性能?
主要发现
- 所提出的状态空间框架实现了非高斯似然高斯过程模型的 O(n) 推理,计算效率显著优于密集方法。
- 卷积插值的使用将矩阵指数计算的运行时间减少了两倍,有效缓解了 O(n) 复杂度中的高常数因子问题。
- 在包含 35,959 个观测值的航空事故数据集上,使用 ADF 推理的模型实现了 0.98±0.02 的预测均方根误差(RMSE)和 1.47±0.01 的负对数似然概率(NLPD)。
- 模型成功捕捉了事故强度中的长期趋势和季节性周期性,清晰展示了随时间衰减的冬季模式。
- 该框架支持通过基于梯度的学习实现所有推理方法的完整超参数优化,实现端到端的可扩展训练。
- GPML 工具箱 v4.2 中的参考实现为实践者提供了统一、生产就绪的工具,可用于将这些方法应用于真实世界的时间序列问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。