Skip to main content
QUICK REVIEW

[论文解读] Deep Canonically Correlated LSTMs

Neil Mallinar, Corbin Rosset|arXiv (Cornell University)|Jan 16, 2018
Time Series Analysis and Forecasting参考文献 15被引用 6
一句话总结

本文提出深度正则相关LSTM(DCC-LSTM),一种利用LSTM学习可变长度序列的非线性时序表征,并通过典型相关分析(CCA)将其投影到共享的、相关联的低维空间的方法。该方法在音素分类和重建任务中优于基线模型,实现了更低的L2重建误差,且参数量少于DCCA。

ABSTRACT

We examine Deep Canonically Correlated LSTMs as a way to learn nonlinear transformations of variable length sequences and embed them into a correlated, fixed dimensional space. We use LSTMs to transform multi-view time-series data non-linearly while learning temporal relationships within the data. We then perform correlation analysis on the outputs of these neural networks to find a correlated subspace through which we get our final representation via projection. This work follows from previous work done on Deep Canonical Correlation (DCCA), in which deep feed-forward neural networks were used to learn nonlinear transformations of data while maximizing correlation.

研究动机与目标

  • 解决现有深度相关模型(如DCCA)的局限性,即需要固定长度输入并损失序列数据中的时序结构。
  • 探究LSTM是否能有效学习多视角时序数据中的时序依赖关系,同时实现基于相关性的表征学习。
  • 开发一种方法,在学习跨视角共享的相关表征的同时,保留序列中的长期时序关系。
  • 评估将LSTM与典型相关分析结合用于无监督表征学习时,对序列数据的有效性。
  • 在真实世界语音数据上,通过分类与重建任务,将DCC-LSTM与DCCA、KCCA、SplitAE及基线模型进行比较。

提出的方法

  • 使用双向LSTM将来自两个视角(如语音特征与发音特征)的可变长度序列编码为固定维数的潜在表征。
  • 对LSTM输出应用典型相关分析(CCA),以学习一个共享的相关子空间,最大化两个视角之间的相关性。
  • 通过CCA将LSTM编码的表征投影到低维空间,实现在保留时序动态的同时进行联合表征学习。
  • 通过优化两个视角表征之间的相关性,以端到端无监督方式训练模型,无需标签。
  • 在消融研究中引入重建目标,与DCCAE比较性能,结果表明重建精度优于基线CCA。
  • 使用t-SNE可视化与k-NN分类评估所学表征的聚类与预测性能。

实验结果

研究问题

  • RQ1LSTM能否有效学习可变长度序列数据的非线性时序表征,以支持多视角表征学习?
  • RQ2将LSTM与典型相关分析结合,是否能为时序数据生成优于标准DCCA的表征?
  • RQ3在分类准确率与重建质量方面,DCC-LSTM相较于其他无监督方法(如KCCA、SplitAE及基线CCA)表现如何?
  • RQ4共享的CCA空间在在多大程度上能保持音素级别的聚类结构,并实现缺失视角的准确重建?
  • RQ5相关性驱动的训练能否成功应用于无监督设置下的LSTM?其性能是否优于仅基于重建的目标?

主要发现

  • DCC-LSTM在音素分类任务中达到84.58%的测试准确率,优于基线CCA(83.20%)与KCCA(77.60%),并匹配性能最佳的SplitAE方法。
  • 在20维CCA空间中,从语音特征重建发音特征时,L2重建误差从基线的43,949降低至26,285。
  • 单样本重建误差从4.395降至2.6286,单向量单分量误差从0.21975降至0.13143,表明重建保真度显著提升。
  • 前20个相关分量捕获了约50%的总相关性,表明少量共享维度已极具信息量。
  • DCC-LSTM在每视角仅使用400个单元时,达到27±3的相关性,而DCCA需使用更宽的网络(1800与1200个单元)才能达到35±5的相关性,表明参数效率更高。
  • 该方法能有效处理含停顿与空格的序列,而DCCA在预处理去除停顿的数据上表现更优,凸显DCC-LSTM对自然语音结构的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。