Skip to main content
QUICK REVIEW

[论文解读] Learning Temporal Dependencies in Data Using a DBN-BLSTM

Kratarth Goel, Raunaq Vohra|arXiv (Cornell University)|Dec 18, 2014
Music and Audio Processing参考文献 6被引用 3
一句话总结

本文提出了一种新颖的深度学习架构 DBN-BLSTM,将深度置信网络(DBNs)与双向长短期记忆(BLSTM)网络相结合,以建模序列数据中的时序依赖关系。通过利用 BLSTM 的隐藏状态动态调节 DBN 的偏置,该模型在保持层次化特征学习的同时捕捉了长程时序模式,在四个基准数据集上的多声部音乐生成任务中实现了最先进(SOTA)的对数似然性能。

ABSTRACT

Since the advent of deep learning, it has been used to solve various problems using many different architectures. The application of such deep architectures to auditory data is also not uncommon. However, these architectures do not always adequately consider the temporal dependencies in data. We thus propose a new generic architecture called the Deep Belief Network - Bidirectional Long Short-Term Memory (DBN-BLSTM) network that models sequences by keeping track of the temporal information while enabling deep representations in the data. We demonstrate this new architecture by applying it to the task of music generation and obtain state-of-the-art results.

研究动机与目标

  • 为解决现有深度架构在捕捉音频和音乐等序列数据中长期时序依赖关系方面的局限性。
  • 将深度置信网络(DBNs)的层次化表征学习能力与双向长短期记忆网络(BLSTMs)的时序建模优势相结合。
  • 开发一种通用的、端到端可训练架构,在不依赖混合 HMM-RNN 框架的前提下提升序列建模性能。
  • 在具有挑战性的生成任务——多声部音乐生成上,验证所提架构的有效性。

提出的方法

  • DBN-BLSTM 通过利用前向和后向 LSTM 链的隐藏状态,在每个时间步动态计算 DBN 的可见层和隐藏层偏置,从而将 DBN 与 BLSTM 集成。
  • 在时间 t 输入 DBN 的是表示钢琴音符事件的二值向量,DBN 通过贪婪预训练和对比散列(contrastive divergence)学习可见层与隐藏层之间的联合概率分布。
  • DBN 的可见层和隐藏层偏置项通过前一时刻 LSTM 隐藏状态与学习得到的变换矩阵的加权组合计算,使时序上下文能够影响层次化表征学习。
  • 模型通过在 BLSTM 上使用时间反向传播(BPTT)进行端到端训练,DBN 预训练采用对比散列方法,所有层均应用 Dropout 进行正则化。
  • 该架构应用于四个数据集的原始 MIDI 数据:JSB Chorales、MuseData、Nottingham 和 Piano-midi.de,未使用任何手工设计的特征。
  • DBN 的采样通过块吉布斯采样(block Gibbs sampling)执行,BLSTM 在每个时间步提供上下文感知的偏置输入,以生成连贯的序列。

实验结果

研究问题

  • RQ1结合 DBNs 与 BLSTMs 的混合架构是否能在捕捉序列数据中的长期时序依赖关系方面超越现有模型?
  • RQ2利用 BLSTM 隐藏状态动态调节 DBN 偏置,如何改善序列建模中的层次化表征学习?
  • RQ3DBN-BLSTM 架构在风格与结构各异的音乐生成数据集上具有多大程度的泛化能力?
  • RQ4与单向 RNN 或标准 DBNs 相比,LSTM 中引入双向上下文是否能提升生成序列的质量与连贯性?
  • RQ5所提出的架构是否能在不依赖外部语言模型或复杂后处理的情况下,实现多声部音乐生成的最先进性能?

主要发现

  • 在 JSB Chorales 数据集上,DBN-BLSTM 的对数似然达到 -3.47,显著优于此前最先进模型 RNN-DBN 的 -5.68。
  • 在 MuseData 数据集上,模型对数似然为 -3.91,优于 RNN-DBN 基线的 -6.28 和 RNN-RBM (HF) 模型的 -6.01。
  • 在 Nottingham 数据集上,模型对数似然为 -1.32,远超 RNN-DBN 基线的 -2.54 和 RNN-NADE (HF) 模型的 -2.31。
  • 在 Piano-midi.de 数据集上,DBN-BLSTM 的对数似然为 -4.63,优于 RNN-DBN 基线的 -7.15 和 RNN-RBM (HF) 模型的 -7.09。
  • 定性评估表明,生成的音乐序列具有连贯性、和声一致性且在音乐上合理,证明了模型生成高质量多声部音乐的能力。
  • 消融实验表明,BLSTM 上下文与 DBN 偏置调制的结合至关重要,缺乏该机制的模型性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。