[论文解读] Stochastic Sequential Neural Networks with Structured Inference
本文提出了一种随机顺序神经网络(SSNN),通过将循环神经网络与结构化推理相结合,以建模高维顺序数据中的长期依赖关系以及离散的分割/标记结构。通过使用Gumbel-Softmax重参数化方法和双向推理机制,SSNN实现了对离散潜在变量的高效、可微训练,在无监督分割、标记以及多对象识别任务中达到了最先进性能。
Unsupervised structure learning in high-dimensional time series data has attracted a lot of research interests. For example, segmenting and labelling high dimensional time series can be helpful in behavior understanding and medical diagnosis. Recent advances in generative sequential modeling have suggested to combine recurrent neural networks with state space models (e.g., Hidden Markov Models). This combination can model not only the long term dependency in sequential data, but also the uncertainty included in the hidden states. Inheriting these advantages of stochastic neural sequential models, we propose a structured and stochastic sequential neural network, which models both the long-term dependencies via recurrent neural networks and the uncertainty in the segmentation and labels via discrete random variables. For accurate and efficient inference, we present a bi-directional inference network by reparamterizing the categorical segmentation and labels with the recent proposed Gumbel-Softmax approximation and resort to the Stochastic Gradient Variational Bayes. We evaluate the proposed model in a number of tasks, including speech modeling, automatic segmentation and labeling in behavior understanding, and sequential multi-objects recognition. Experimental results have demonstrated that our proposed model can achieve significant improvement over the state-of-the-art methods.
研究动机与目标
- 为解决高维顺序数据(如生理信号或行为序列中的分段边界和标签)中无监督结构学习的挑战。
- 实现对顺序数据中长期依赖关系以及离散、可解释的潜在结构(分割和标签)的有效建模。
- 通过引入结构化、双向推理机制,克服在具有离散潜在变量的深度神经网络中训练的困难。
- 通过Gumbel-Softmax重参数化方法,提升具有类别潜在变量的顺序模型的推理效率与准确性。
- 在包括语音建模、行为理解、医学诊断和多对象识别在内的多样化任务中,验证所提模型的有效性。
提出的方法
- 模型采用受隐半马尔可夫模型(HSMMs)启发的生成网络,包含来自RNN的连续隐藏状态,以及两个离散序列:分割变量和分段标签。
- 通过Gumbel-Softmax技巧对离散潜在变量(分割和标签)进行重参数化,使其在保持类别性质的同时支持可微训练。
- 设计了双向推理网络,以利用前后向时间上下文,提升对离散潜在变量的后验近似能力。
- 采用随机梯度变分贝叶斯(SGVB)方法进行端到端训练,通过重参数化梯度优化变分下界(ELBO)。
- 模型联合学习分段的持续时间及其标签,通过增强的隐藏状态,使推理同时依赖于过去和未来上下文。
- 架构采用小批量随机梯度下降(SGD)进行端到端训练,固定最大序列长度,并对持续时间进行截断,以防止计算爆炸。
实验结果
研究问题
- RQ1深度神经网络能否在无显式监督的情况下,有效学习高维顺序数据中可解释的分段边界和标签?
- RQ2在深度学习框架中,如何高效地对离散潜在变量(分割和标签)进行可微优化?
- RQ3在推理网络中引入双向时间上下文是否能提升顺序数据结构化推理的准确性?
- RQ4所提模型是否能在多样化的基准上超越现有最先进方法,在无监督顺序结构学习任务中表现更优?
- RQ5该模型在涉及空间与顺序依赖关系的复杂任务(如图像中的多对象识别)中泛化能力如何?
主要发现
- SSNN在所有评估数据集中均达到最低平均误差率,Drosophila数据集为14.70 ± 5.45%,PhysioNet数据集为29.29 ± 5.34%,优于subHSMM、HDP-HSMM、CRF-AE和rHSMM-dp。
- 在multi-MNIST数据集中,SSNN成功识别出图像中三个数字的数量及其位置,而DRAW模型有时会遗漏数据模式,表明SSNN具有更优的模式覆盖能力和解耦性。
- 结合Gumbel-Softmax重参数化的双向推理网络,实现了离散潜在变量的精确且稳定的训练,避免了离散变分推理中常见的梯度问题。
- 模型在无监督设置下展现出强大的泛化能力,无需监督或课程学习,即可从原始序列中学习到有意义的分段与标签。
- 在语音与行为建模任务中,SSNN显著提升了分段与标记的准确性,证实其在真实顺序数据分析中的有效性。
- 消融实验表明,双向推理与离散变量的结构化建模是模型性能的关键因素,其移除导致性能显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。