Skip to main content
QUICK REVIEW

[论文解读] Speech Recognition with Deep Recurrent Neural Networks

Alex Graves, Abdelrahman Mohamed|arXiv (Cornell University)|Mar 22, 2013
Speech Recognition and Synthesis参考文献 21被引用 10
一句话总结

本文提出使用端到端训练的深度双向长短期记忆(LSTM)循环神经网络,并结合连接时序分类(CTC)与权重噪声正则化,实现了在TIMIT基准测试中17.7%的音素错误率,创下当时最优性能——表明时间与空间上的深度结构显著提升了语音识别性能,优于以往的RNN与前馈网络方法。

ABSTRACT

Recurrent neural networks (RNNs) are a powerful model for sequential data. End-to-end training methods such as Connectionist Temporal Classification make it possible to train RNNs for sequence labelling problems where the input-output alignment is unknown. The combination of these methods with the Long Short-term Memory RNN architecture has proved particularly fruitful, delivering state-of-the-art results in cursive handwriting recognition. However RNN performance in speech recognition has so far been disappointing, with better results returned by deep feedforward networks. This paper investigates \emph{deep recurrent neural networks}, which combine the multiple levels of representation that have proved so effective in deep networks with the flexible use of long range context that empowers RNNs. When trained end-to-end with suitable regularisation, we find that deep Long Short-term Memory RNNs achieve a test set error of 17.7% on the TIMIT phoneme recognition benchmark, which to our knowledge is the best recorded score.

研究动机与目标

  • 探究通过堆叠多个LSTM层构建的深层循环神经网络,是否能在语音识别性能上超越标准RNN与前馈网络。
  • 评估基于连接时序分类(CTC)与Transducer框架的端到端训练在序列标注任务中的有效性。
  • 评估双向上下文、网络架构深度以及正则化技术(如权重噪声)对音素识别准确率的影响。
  • 确定深层LSTM是否能在语音识别任务中超越浅层或非循环深层网络。

提出的方法

  • 通过堆叠多个循环层构建深层双向长短期记忆(LSTM)网络,实现在时间与深度上的分层表征学习。
  • 采用连接时序分类(CTC)实现端到端训练,无需强制对齐即可处理可变长度输入输出对齐。
  • 引入权重噪声正则化,每轮训练序列仅应用一次,通过简化学习表征来提升泛化能力。
  • 使用双向LSTM(BLSTM)通过正向与反向处理输入序列,获取过去与未来的上下文信息。
  • 推理时采用束搜索解码,束宽为100,确保序列预测的鲁棒性。
  • 采用两阶段训练策略:先无噪声训练,再通过高斯权重噪声(σ = 0.075)微调,以最小化开发集错误率。

实验结果

研究问题

  • RQ1堆叠多个循环层(空间上的深度)是否能显著提升RNN在语音识别中的性能,超越标准RNN固有的时间深度?
  • RQ2结合双向LSTM与通过CTC或Transducer实现的端到端训练,是否能在语音识别基准上超越单向或非循环深层网络?
  • RQ3通过权重噪声正则化如何影响深层LSTM模型在语音识别中的泛化能力与性能表现?
  • RQ4架构深度带来的性能提升是否比增加每层的隐藏单元数量更为显著?
  • RQ5当与深层双向LSTM结合时,通过联合声学与语言建模(通过Transducer)实现的端到端训练是否能进一步提升性能?

主要发现

  • 采用CTC与权重噪声的深层双向LSTM(PreTrans-3l-250h)在TIMIT核心测试集上实现了17.7%的音素错误率(PER),为当时报告的最佳结果。
  • 网络深度从1层增至5层,使CTC错误率从23.9%降至18.4%,表明空间深度的影响大于增加网络宽度。
  • LSTM单元相比标准tanh单元表现显著更优,CTC-3l-500h-tanh(tanh)达到37.6% PER,而CTC-3l-250h(LSTM)仅为18.6%。
  • 双向LSTM相比单向LSTM表现出微弱但一致的优势,CTC-3l-421h-uni(单向)达到19.6% PER,其双向对应模型为18.6%。
  • 通过独立的音素预测网络对Transducer模型进行预训练,使性能从18.3%(Trans-3l-250h)提升至17.7%(PreTrans-3l-250h),表明联合建模具有优势。
  • 输入敏感性分析表明,输出预测依赖于多个音素的上下文信息,表明CTC网络可仅从声学数据中隐式学习语言依赖关系。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。