Skip to main content
QUICK REVIEW

[论文解读] The Neural Moving Average Model for Scalable Variational Inference of State Space Models

Tom Ryder, Dennis Prangle|arXiv (Cornell University)|Oct 2, 2019
Fault Detection and Control Systems被引用 10
一句话总结

该论文提出神经移动平均(nMA)模型,一种新颖的生成框架,用于状态空间模型,通过确保潜变量状态采样中的局部性,实现可扩展的 mini-batch 变分推断。通过使用感受野有限的卷积神经网络,nMA 实现了子序列的高效、O(1) 成本采样,促进了随机梯度优化,并在长时序数据上实现了分钟级的精确参数估计,即使在稀疏或部分观测的情况下亦如此。

ABSTRACT

Variational inference has had great success in scaling approximate Bayesian inference to big data by exploiting mini-batch training. To date, however, this strategy has been most applicable to models of independent data. We propose an extension to state space models of time series data based on a novel generative model for latent temporal states: the neural moving average model. This permits a subsequence to be sampled without drawing from the entire distribution, enabling training iterations to use mini-batches of the time series at low computational cost. We illustrate our method on autoregressive, Lotka-Volterra, FitzHugh-Nagumo and stochastic volatility models, achieving accurate parameter estimation in a short time.

研究动机与目标

  • 解决由于似然评估成本为 O(T) 而导致的长时序状态空间模型中贝叶斯推断的计算不可行性。
  • 通过引入具有局部性特性的变分族,实现对连续状态 SSM 的可扩展变分推断,以支持高效的 mini-batch 训练。
  • 开发一种潜变量状态的生成模型,支持从 mini-batch 中无偏估计完整对数密度,同时捕捉复杂的时序依赖关系。
  • 在具有稀疏观测、部分状态访问、低观测噪声和大 T 的挑战性 SSM 上展示方法的有效性,包括真实世界数据。

提出的方法

  • 提出基于归一化流的神经移动平均(nMA)模型,该模型通过独立同分布的 N(0,1) 噪声和观测数据的卷积变换生成潜变量状态。
  • 使用感受野有限的卷积神经网络(CNN),确保每个潜变量状态仅依赖于输入的局部窗口,从而实现子序列的 O(1) 采样。
  • 将 nMA 视为归一化流,以实现从 mini-batch 样本中无偏估计潜变量链的完整对数密度。
  • 采用随机梯度变分推断,通过 mini-batch 梯度最小化近似后验与真实后验之间的 KL 散度。
  • 使用摊销推断,通过识别网络参数化变分后验 q(x|y;φ)。
  • 将该框架应用于自回归模型、Lotka-Volterra 模型、FitzHugh-Nagumo 模型和随机波动率模型,实现在长时序数据上的可扩展训练。

实验结果

研究问题

  • RQ1能否通过实现潜变量状态的 mini-batch 采样,使状态空间模型的变分推断方法在每轮训练中达到 O(1) 成本?
  • RQ2能否通过神经生成模型实现潜变量状态的无偏完整对数密度估计,从而支持可扩展推断?
  • RQ3所提出的基于 nMA 的变分推断方法是否能在具有长时序、稀疏观测和未观测分量的状态空间模型中实现精确的参数估计?
  • RQ4在如随机波动率和 FitzHugh-Nagumo 等挑战性 SSM 上,该方法在准确性和训练时间上与现有方法相比表现如何?

主要发现

  • nMA 模型通过限制 CNN 的感受野,实现了潜变量状态子序列的 O(1) 成本采样,满足了 mini-batch 训练所需的局部性特性。
  • 该方法在所有测试模型中均实现了精确的后验估计,包括存在未观测分量和稀疏观测的模型,部分情况下结果与真实后验无法区分。
  • 对 1,000,000 步的 FitzHugh-Nagumo 模型进行训练耗时约 180 分钟,参数估计结果与真实值一致。
  • 在单张 GPU 上,仅用 20 分钟就对 1,508 个每周观测的随机波动率模型完成分析,结果与先前 MCMC 方法的结果一致。
  • 该方法在训练速度和可扩展性方面优于以往的变分方法,尤其在长时序数据上表现更优,同时保持了高精度。
  • 该方法成功处理了低观测方差和部分状态观测等挑战性观测情形,展现出鲁棒性和灵活性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。