[论文解读] Long Short-Term Memory based Convolutional Recurrent Neural Networks for Large Vocabulary Speech Recognition
本文提出了一种基于长短期记忆网络的卷积循环神经网络(LSTM-CRNN),通过在频率轴上结合卷积操作与在时间轴上应用循环LSTM处理,以提升大规模词汇量语音识别性能。该模型相较于强大的LSTM基线模型,实现了7.1%的相对词错误率降低,在大规模对话式电话语音识别任务中展现出最先进性能。
Long short-term memory (LSTM) recurrent neural networks (RNNs) have been shown to give state-of-the-art performance on many speech recognition tasks, as they are able to provide the learned dynamically changing contextual window of all sequence history. On the other hand, the convolutional neural networks (CNNs) have brought significant improvements to deep feed-forward neural networks (FFNNs), as they are able to better reduce spectral variation in the input signal. In this paper, a network architecture called as convolutional recurrent neural network (CRNN) is proposed by combining the CNN and LSTM RNN. In the proposed CRNNs, each speech frame, without adjacent context frames, is organized as a number of local feature patches along the frequency axis, and then a LSTM network is performed on each feature patch along the time axis. We train and compare FFNNs, LSTM RNNs and the proposed LSTM CRNNs at various number of configurations. Experimental results show that the LSTM CRNNs can exceed state-of-the-art speech recognition performance.
研究动机与目标
- 为解决固定上下文窗口模型在处理语音信号中时间与频谱可变性方面的局限性。
- 通过将卷积神经网络的频域不变性与长短期记忆RNN的动态上下文学习能力相结合,改进声学建模。
- 探究将卷积结构与循环结构结合是否能在大规模词汇量语音识别中超越独立的深度神经网络、LSTM RNN或卷积神经网络。
- 评估池化、投影层及深度堆叠等架构组件对识别性能的影响。
提出的方法
- 将每个语音帧沿频率轴划分为局部特征块,实现局部频谱处理。
- 在时间轴上对每个频率块独立应用单向LSTM,通过动态上下文建模时间依赖性。
- 该架构用基于LSTM的滤波器替代标准卷积滤波器,使网络能够为每个频率块学习自适应的时间上下文。
- 模型使用3层ReLU激活函数引入非线性,并采用大小为3的池化层以减少参数量并提升泛化能力。
- 测试了多种配置,包括带有投影头以减少参数量的CLSTM和CLSTMP层的深度堆叠结构。
- 序列判别式训练被列为未来工作,但本研究中尚未实现。
实验结果
研究问题
- RQ1将卷积神经网络与长短期记忆RNN结合在混合架构中,是否能相比独立的深度神经网络或LSTM RNN提升大规模词汇量语音识别性能?
- RQ2将频域卷积处理与时域循环处理相结合,对频谱与时间变化的建模有何影响?
- RQ3池化、投影层及深度堆叠等架构选择对识别准确率与参数效率有何影响?
- RQ4所提出的CRNN架构是否在大规模语音识别任务中优于最先进LSTM基线系统?
主要发现
- 所提出的LSTM-CRNN模型相较于强基线LSTM系统,实现了7.1%的相对词错误率(WER)降低。
- 表现最佳的配置为先使用CLSTMP层,再接第二层LSTMP层,在测试集上达到31.43%的CER。
- 将LSTM单元数从256增加到384,使CER从34.81%降至34.12%,表明模型容量增大可带来性能提升。
- 在CLSTMP网络中使用投影层在不降低性能的前提下减少了参数量,从而实现更高效的模型。
- 堆叠两层卷积循环层相比单层模型实现了3.8%的相对WER提升。
- 采用512个LSTM单元和256维投影层的模型(CLstm512P256)达到34.03%的CER,表明随着模型容量增加,性能仍持续提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。