[论文解读] A novel pyramidal-FSMN architecture with lattice-free MMI for speech recognition
该论文提出了一种新型的分层-FSMN架构,通过在各层之间整合分层记忆结构并引入残差卷积网络(res-CNN)以提升特征提取能力,从而增强语音识别性能。结合无网格最大互信息(lattice-free MMI)与交叉熵(CE)联合训练,该方法在Librispeech数据集上实现了3.62%的词错误率(WER),在使用RNNLM重打分后进一步降低至2.97%,展示了当时最先进的性能表现。
Deep Feedforward Sequential Memory Network (DFSMN) has shown superior performance on speech recognition tasks. Based on this work, we propose a novel network architecture which introduces pyramidal memory structure to represent various context information in different layers. Additionally, res-CNN layers are added in the front to extract more sophisticated features as well. Together with lattice-free maximum mutual information (LF-MMI) and cross entropy (CE) joint training criteria, experimental results show that this approach achieves word error rates (WERs) of 3.62% and 10.89% respectively on Librispeech and LDC97S62 (Switchboard 300 hours) corpora. Furthermore, Recurrent neural network language model (RNNLM) rescoring is applied and a WER of 2.97% is obtained on Librispeech.
研究动机与目标
- 通过增强深度神经网络中的上下文建模能力,提升语音识别性能。
- 解决标准FSMN在捕捉多尺度时间依赖性方面的局限性。
- 集成残差卷积层以获得更丰富的特征表示。
- 利用无网格最大互信息训练优化声学模型,无需强制对齐。
- 在Librispeech和Switchboard基准测试中实现最先进结果。
提出的方法
- 提出一种分层记忆结构,通过跨层的时间池化与线性变换,分层建模长程依赖关系。
- 在前端引入残差卷积(res-CNN)层,从原始输入中提取分层的、具有判别性的特征。
- 采用深度前馈序列记忆网络(DFSMN)作为主干网络,并通过分层结构实现多感受野建模。
- 采用无网格最大互信息(LF-MMI)与交叉熵(CE)联合训练策略,以提升声学模型的泛化能力。
- 使用RNNLM重打分进一步优化预测结果,降低词错误率。
实验结果
研究问题
- RQ1分层记忆结构能否提升基于FSMN的语音识别系统中的上下文建模能力?
- RQ2增加残差卷积层是否能增强端到端语音识别中的特征表示能力?
- RQ3与标准训练相比,联合使用LF-MMI与CE训练是否能进一步降低WER?
- RQ4所提出的架构在Librispeech和Switchboard等标准基准上的表现如何?
- RQ5当与新架构结合时,RNNLM重打分在多大程度上能降低WER?
主要发现
- 所提出的分层-FSMN在Librispeech测试集上实现了3.62%的词错误率(WER),优于以往基于FSMN的模型。
- 在LDC97S62(Switchboard 300小时)语料上,该模型实现了10.89%的WER,表现出强大的泛化能力。
- 经RNNLM重打分后,Librispeech上的WER进一步降低至2.97%,接近最先进水平。
- 残差卷积层的引入显著提升了特征提取能力,从而提高了模型准确率。
- 联合使用LF-MMI与CE训练增强了模型的鲁棒性与泛化能力,尤其在低资源场景下表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。