Skip to main content
QUICK REVIEW

[论文解读] Fast and Accurate Recurrent Neural Network Acoustic Models for Speech Recognition

Haşim Sak, Andrew Senior|arXiv (Cornell University)|Jul 24, 2015
Speech Recognition and Synthesis被引用 7
一句话总结

本论文通过使用帧堆叠、降低帧率、上下文相关(CD)音素建模以及基于sMBR和CTC的序列训练,对大规模词汇量语音识别的LSTM RNN声学模型进行了改进。这些技术显著提升了准确率——CD音素CTC模型相比传统混合模型实现了8%的相对错误率降低——同时还能实现直接的词级别建模,在无语言模型的中等词汇量任务中也取得了有前景的结果。

ABSTRACT

We have recently shown that deep Long Short-Term Memory (LSTM) recurrent neural networks (RNNs) outperform feed forward deep neural networks (DNNs) as acoustic models for speech recognition. More recently, we have shown that the performance of sequence trained context dependent (CD) hidden Markov model (HMM) acoustic models using such LSTM RNNs can be equaled by sequence trained phone models initialized with connectionist temporal classification (CTC). In this paper, we present techniques that further improve performance of LSTM RNN acoustic models for large vocabulary speech recognition. We show that frame stacking and reduced frame rate lead to more accurate models and faster decoding. CD phone modeling leads to further improvements. We also present initial results for LSTM RNN models outputting words directly.

研究动机与目标

  • 提升LSTM RNN声学模型在大规模词汇量语音识别(LVCSR)中的准确率与效率。
  • 探究帧堆叠与降低帧率在稳定CTC训练和加速解码方面的有效性。
  • 评估上下文相关(CD)音素建模与CTC训练的LSTM RNN中直接词级别输出的效果。
  • 将基于CTC的模型与传统混合HMM-DNN系统进行比较,并通过序列训练评估性能提升。

提出的方法

  • 使用单向和双向深层LSTM RNN,通过堆叠层来建模语音特征中的时序依赖性。
  • 采用带空白符号的联结时序分类(CTC)方法,处理可变长度对齐,无需强制对齐。
  • 应用帧堆叠与降低帧率以提升训练稳定性并降低计算成本。
  • 使用异步随机梯度下降(ASGD)在大规模集群上进行分布式训练。
  • 在初始训练后,应用序列判别性训练,采用sMBR准则优化CTC模型。
  • 使用CTC端到端训练词级别声学模型,直接从原始特征预测词,无需语言模型。

实验结果

研究问题

  • RQ1帧堆叠与降低帧率是否能改善CTC训练的LSTM RNN在语音识别中的收敛稳定性与推理速度?
  • RQ2在基于CTC的LSTM RNN中,上下文相关(CD)音素建模是否显著优于上下文无关或状态级建模?
  • RQ3通过CTC实现的直接词级别声学建模是否能在无语言模型或语言模型解码的情况下实现具有竞争力的识别准确率?
  • RQ4与标准交叉熵训练相比,sMBR序列训练如何影响基于CTC的LSTM RNN的性能?
  • RQ5为何传统对齐方法在无空白符号的RNN中会失效,而CTC如何解决此问题?

主要发现

  • 结合CTC与sMBR训练的CD音素建模,相比最佳传统混合LSTM模型,将词错误率(WER)降低了8%相对误差。
  • 帧堆叠与降低帧率提升了训练稳定性,减少了解码时间,同时保持或提升了准确率。
  • 使用7,000词词汇量的双向CTC模型在保留数据上达到11.8%的WER,比单向模型低25%。
  • 使用25,000词词汇量的词级别CTC模型在词汇内词上达到14.5%的WER,表明其在中等词汇量任务中的可行性。
  • 未使用空白符号训练的模型产生了任意对齐,证实空白符号在CTC中对稳定序列建模的必要性。
  • CTC模型的标签后验概率显示出尖峰状、非均匀的预测,与语音音素边界对齐,即使无语言模型也表现出鲁棒的时序定位能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。