Skip to main content
QUICK REVIEW

[论文解读] A novel pyramidal-FSMN architecture with lattice-free MMI for speech recognition

Xuerui Yang, Jiwei Li|arXiv (Cornell University)|Oct 26, 2018
Speech Recognition and Synthesis参考文献 16被引用 13
一句话总结

该论文提出了一种新型的分层-FSMN架构,通过在各层之间整合分层记忆结构并引入残差卷积网络(res-CNN)以提升特征提取能力,从而增强语音识别性能。结合无网格最大互信息(lattice-free MMI)与交叉熵(CE)联合训练,该方法在Librispeech数据集上实现了3.62%的词错误率(WER),在使用RNNLM重打分后进一步降低至2.97%,展示了当时最先进的性能表现。

ABSTRACT

Deep Feedforward Sequential Memory Network (DFSMN) has shown superior performance on speech recognition tasks. Based on this work, we propose a novel network architecture which introduces pyramidal memory structure to represent various context information in different layers. Additionally, res-CNN layers are added in the front to extract more sophisticated features as well. Together with lattice-free maximum mutual information (LF-MMI) and cross entropy (CE) joint training criteria, experimental results show that this approach achieves word error rates (WERs) of 3.62% and 10.89% respectively on Librispeech and LDC97S62 (Switchboard 300 hours) corpora. Furthermore, Recurrent neural network language model (RNNLM) rescoring is applied and a WER of 2.97% is obtained on Librispeech.

研究动机与目标

  • 通过增强深度神经网络中的上下文建模能力,提升语音识别性能。
  • 解决标准FSMN在捕捉多尺度时间依赖性方面的局限性。
  • 集成残差卷积层以获得更丰富的特征表示。
  • 利用无网格最大互信息训练优化声学模型,无需强制对齐。
  • 在Librispeech和Switchboard基准测试中实现最先进结果。

提出的方法

  • 提出一种分层记忆结构,通过跨层的时间池化与线性变换,分层建模长程依赖关系。
  • 在前端引入残差卷积(res-CNN)层,从原始输入中提取分层的、具有判别性的特征。
  • 采用深度前馈序列记忆网络(DFSMN)作为主干网络,并通过分层结构实现多感受野建模。
  • 采用无网格最大互信息(LF-MMI)与交叉熵(CE)联合训练策略,以提升声学模型的泛化能力。
  • 使用RNNLM重打分进一步优化预测结果,降低词错误率。

实验结果

研究问题

  • RQ1分层记忆结构能否提升基于FSMN的语音识别系统中的上下文建模能力?
  • RQ2增加残差卷积层是否能增强端到端语音识别中的特征表示能力?
  • RQ3与标准训练相比,联合使用LF-MMI与CE训练是否能进一步降低WER?
  • RQ4所提出的架构在Librispeech和Switchboard等标准基准上的表现如何?
  • RQ5当与新架构结合时,RNNLM重打分在多大程度上能降低WER?

主要发现

  • 所提出的分层-FSMN在Librispeech测试集上实现了3.62%的词错误率(WER),优于以往基于FSMN的模型。
  • 在LDC97S62(Switchboard 300小时)语料上,该模型实现了10.89%的WER,表现出强大的泛化能力。
  • 经RNNLM重打分后,Librispeech上的WER进一步降低至2.97%,接近最先进水平。
  • 残差卷积层的引入显著提升了特征提取能力,从而提高了模型准确率。
  • 联合使用LF-MMI与CE训练增强了模型的鲁棒性与泛化能力,尤其在低资源场景下表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。