Skip to main content
QUICK REVIEW

[论文解读] Constructing Long Short-Term Memory based Deep Recurrent Neural Networks for Large Vocabulary Speech Recognition

Xiangang Li, Xihong Wu|arXiv (Cornell University)|Oct 16, 2014
Speech Recognition and Synthesis参考文献 18被引用 12
一句话总结

本文提出新颖的深层长短期记忆(LSTM)架构,以提升大规模词汇量语音识别性能。通过在中文对话式电话语音任务中,对LSTM网络进行深层输入到隐藏层、隐藏层到隐藏层以及隐藏层到输出层的扩展——特别是LSTM-OP和堆叠LSTM变体——作者取得了最先进结果,将词错误率(CER)从DNN的38.01%降低至34.65%。

ABSTRACT

Long short-term memory (LSTM) based acoustic modeling methods have recently been shown to give state-of-the-art performance on some speech recognition tasks. To achieve a further performance improvement, in this research, deep extensions on LSTM are investigated considering that deep hierarchical model has turned out to be more efficient than a shallow one. Motivated by previous research on constructing deep recurrent neural networks (RNNs), alternative deep LSTM architectures are proposed and empirically evaluated on a large vocabulary conversational telephone speech recognition task. Meanwhile, regarding to multi-GPU devices, the training process for LSTM networks is introduced and discussed. Experimental results demonstrate that the deep LSTM networks benefit from the depth and yield the state-of-the-art performance on this task.

研究动机与目标

  • 探索在空间维度(超越时间深度)加深LSTM网络,以改进语音识别的声学建模性能。
  • 在大规模语音识别任务上评估替代的深层LSTM架构(如LSTM-OP、堆叠LSTM和混合设计)的性能。
  • 研究多GPU训练在序列建模背景下对深层LSTM网络训练效率的影响。
  • 比较深层LSTM变体与标准浅层LSTM及前馈DNN在识别准确率方面的表现。
  • 识别在最大化性能的同时最小化计算成本的最优架构组合。

提出的方法

  • 通过修改三个组件(输入到隐藏层、隐藏层到隐藏层、隐藏层到输出层)的函数,设计深层LSTM变体。
  • 引入LSTM-OP(输出投影)和LSTM-IP(输入投影)架构,以增强表征能力。
  • 在多GPU系统上使用截断时间反向传播(BPTT)进行训练,以加速收敛。
  • 构建混合模型,将深层隐藏层到隐藏层转换与LSTM-OP顶部的前馈层结合,以提升性能。
  • 采用连结时序分类(CTC)进行序列建模,并通过判别式训练优化对齐。
  • 在记忆单元中使用窥视孔连接和tanh激活函数,以改善时间控制和状态管理。

实验结果

研究问题

  • RQ1在空间维度(超越时间深度)加深LSTM网络是否能提升大规模词汇量语音识别的性能?
  • RQ2在大规模对话式语音任务中,LSTM-OP、堆叠LSTM或混合设计等架构变体中,哪一种能实现最佳识别准确率?
  • RQ3深层LSTM网络在词错误率(WER)方面与标准浅层LSTM及前馈DNN相比表现如何?
  • RQ4结合深层输入到隐藏层、隐藏层到隐藏层以及隐藏层到输出层函数对识别性能有何影响?
  • RQ5多GPU训练能否在不损害收敛性或准确率的前提下,高效扩展深层LSTM网络的训练?

主要发现

  • 具有三层前馈中间层的深层LSTM-OP网络实现了最佳性能,将CER降低至34.65%。
  • LSTM-OP架构优于标准浅层LSTM和堆叠LSTM,在CER上相比浅层LSTM实现了13.98%的相对降低。
  • 与前馈DNN(CER为38.01%)相比,深层LSTM网络将CER降低了8.87%,显著提升了准确率。
  • 堆叠LSTM-OP层(3层)的性能优于堆叠LSTM-IP层,但两者均不如与前馈层结合的混合结构有效。
  • 结合LSTM-OP与三层前馈层的混合模型在计算量低于更深堆叠架构的情况下,实现了最佳准确率。
  • 多GPU训练通过截断BPTT实现了深层LSTM网络的高效且可扩展训练,支持大规模实验。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。