[论文解读] Constructing Long Short-Term Memory based Deep Recurrent Neural Networks for Large Vocabulary Speech Recognition
本文提出新颖的深层长短期记忆(LSTM)架构,以提升大规模词汇量语音识别性能。通过在中文对话式电话语音任务中,对LSTM网络进行深层输入到隐藏层、隐藏层到隐藏层以及隐藏层到输出层的扩展——特别是LSTM-OP和堆叠LSTM变体——作者取得了最先进结果,将词错误率(CER)从DNN的38.01%降低至34.65%。
Long short-term memory (LSTM) based acoustic modeling methods have recently been shown to give state-of-the-art performance on some speech recognition tasks. To achieve a further performance improvement, in this research, deep extensions on LSTM are investigated considering that deep hierarchical model has turned out to be more efficient than a shallow one. Motivated by previous research on constructing deep recurrent neural networks (RNNs), alternative deep LSTM architectures are proposed and empirically evaluated on a large vocabulary conversational telephone speech recognition task. Meanwhile, regarding to multi-GPU devices, the training process for LSTM networks is introduced and discussed. Experimental results demonstrate that the deep LSTM networks benefit from the depth and yield the state-of-the-art performance on this task.
研究动机与目标
- 探索在空间维度(超越时间深度)加深LSTM网络,以改进语音识别的声学建模性能。
- 在大规模语音识别任务上评估替代的深层LSTM架构(如LSTM-OP、堆叠LSTM和混合设计)的性能。
- 研究多GPU训练在序列建模背景下对深层LSTM网络训练效率的影响。
- 比较深层LSTM变体与标准浅层LSTM及前馈DNN在识别准确率方面的表现。
- 识别在最大化性能的同时最小化计算成本的最优架构组合。
提出的方法
- 通过修改三个组件(输入到隐藏层、隐藏层到隐藏层、隐藏层到输出层)的函数,设计深层LSTM变体。
- 引入LSTM-OP(输出投影)和LSTM-IP(输入投影)架构,以增强表征能力。
- 在多GPU系统上使用截断时间反向传播(BPTT)进行训练,以加速收敛。
- 构建混合模型,将深层隐藏层到隐藏层转换与LSTM-OP顶部的前馈层结合,以提升性能。
- 采用连结时序分类(CTC)进行序列建模,并通过判别式训练优化对齐。
- 在记忆单元中使用窥视孔连接和tanh激活函数,以改善时间控制和状态管理。
实验结果
研究问题
- RQ1在空间维度(超越时间深度)加深LSTM网络是否能提升大规模词汇量语音识别的性能?
- RQ2在大规模对话式语音任务中,LSTM-OP、堆叠LSTM或混合设计等架构变体中,哪一种能实现最佳识别准确率?
- RQ3深层LSTM网络在词错误率(WER)方面与标准浅层LSTM及前馈DNN相比表现如何?
- RQ4结合深层输入到隐藏层、隐藏层到隐藏层以及隐藏层到输出层函数对识别性能有何影响?
- RQ5多GPU训练能否在不损害收敛性或准确率的前提下,高效扩展深层LSTM网络的训练?
主要发现
- 具有三层前馈中间层的深层LSTM-OP网络实现了最佳性能,将CER降低至34.65%。
- LSTM-OP架构优于标准浅层LSTM和堆叠LSTM,在CER上相比浅层LSTM实现了13.98%的相对降低。
- 与前馈DNN(CER为38.01%)相比,深层LSTM网络将CER降低了8.87%,显著提升了准确率。
- 堆叠LSTM-OP层(3层)的性能优于堆叠LSTM-IP层,但两者均不如与前馈层结合的混合结构有效。
- 结合LSTM-OP与三层前馈层的混合模型在计算量低于更深堆叠架构的情况下,实现了最佳准确率。
- 多GPU训练通过截断BPTT实现了深层LSTM网络的高效且可扩展训练,支持大规模实验。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。