[论文解读] Scaling Factorial Hidden Markov Models: Stochastic Variational Inference without Messages
该论文提出了一种用于因子隐藏马尔可夫模型(FHMMs)的可扩展随机变分推断算法,通过使用共享前馈神经网络参数化二元高斯 copula 链,消除了消息传递机制。该方法实现了长序列上的分布式、随机优化,在大规模数据上性能优于结构化平均场方法,且无额外近似偏差。
Factorial Hidden Markov Models (FHMMs) are powerful models for sequential data but they do not scale well with long sequences. We propose a scalable inference and learning algorithm for FHMMs that draws on ideas from the stochastic variational inference, neural network and copula literatures. Unlike existing approaches, the proposed algorithm requires no message passing procedure among latent variables and can be distributed to a network of computers to speed up learning. Our experiments corroborate that the proposed algorithm does not introduce further approximation bias compared to the proven structured mean-field algorithm, and achieves better performance with long sequences and large FHMMs.
研究动机与目标
- 解决在长序列和大状态空间下,FHMMs 精确推断的计算不可行性问题。
- 消除在 FHMMs 变分推断中对消息传递的需求,以支持分布式计算。
- 通过使用共享识别神经网络重参数化 copula 参数,将变分推断扩展至长序列。
- 在保持与结构化平均场方法相当近似精度的同时,实现在大规模数据集上的随机优化。
- 在传统方法因计算限制而失效的长序列和大模型上,展示更优性能。
提出的方法
- 该方法使用二元高斯 copula 对 FHMMs 中潜变量之间的依赖关系进行建模,替代传统的消息传递方案。
- 引入共享前馈神经网络(识别网络)以跨时间点参数化 copula 链参数,实现高效且可扩展的推断。
- 算法采用小批量随机子链采样的随机梯度下降法,以优化对数边缘似然的随机下界。
- 识别网络与模型参数(协方差、发射权重、转移矩阵)通过端到端优化联合训练。
- 该方法避免了潜变量之间的显式消息传递,支持在多个计算节点上并行化。
- 重参数化技术使反向传播能够通过随机子链,使该方法适用于深度学习优化技术。
实验结果
研究问题
- RQ1我们能否在不依赖消息传递的情况下,将 FHMM 推断扩展至长序列?
- RQ2使用神经网络与子链采样的随机变分推断方法,在近似精度上是否与结构化平均场方法相当?
- RQ3在计算资源有限的条件下,该方法在长序列上是否能在模型似然和预测性能方面优于结构化平均场方法?
- RQ4使用共享识别网络是否可行地解耦无界长度随机过程中的推断?
- RQ5该方法能否有效利用大规模序列数据以提升模型性能?
主要发现
- 在短序列上,所提算法与结构化平均场方法性能相当,如在模拟数据和巴赫颂歌曲数据中,对数似然值相近。
- 在长序列上,所提方法在固定计算预算下显著优于结构化平均场方法,后者在长度为 150,000 的序列上甚至无法完成单次迭代。
- 在包含 100 万时间步的家用电力消耗数据集中,所提方法的测试均方误差(MSE)为 0.106(平均值),低于 SMF-EM 的 0.194,表明预测精度更高。
- 对于 6 维电力消耗数据,所提方法在某些维度上将 MSE 降低了高达 65%,表明在大规模数据上具有更好的模型拟合能力。
- 该算法成功在 10 链 FHMM 上训练了 100 万步的序列,而 SMF-EM 因计算限制无法完成此任务。
- 使用共享识别网络降低了内存和计算成本,使方法在马尔可夫链数量增加时仍具可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。