Skip to main content
QUICK REVIEW

[论文解读] Deep-FSMN for Large Vocabulary Continuous Speech Recognition

Shiliang Zhang, Ming Lei|arXiv (Cornell University)|Mar 4, 2018
Speech Recognition and Synthesis被引用 13
一句话总结

该论文提出Deep-FSMN(DFSMN),一种通过层间跳跃连接增强的前馈序列记忆网络,以缓解深层网络中的梯度消失问题。通过引入跳跃连接并结合低帧率(LFR)处理,DFSMN在英语Fisher数据集上实现1.5%的绝对WER降低(9.4% WER),在20,000小时普通话任务上实现20%以上的相对WER改进,同时支持可控制的前瞻滤波器阶数,实现低延迟推理。

ABSTRACT

In this paper, we present an improved feedforward sequential memory networks (FSMN) architecture, namely Deep-FSMN (DFSMN), by introducing skip connections between memory blocks in adjacent layers. These skip connections enable the information flow across different layers and thus alleviate the gradient vanishing problem when building very deep structure. As a result, DFSMN significantly benefits from these skip connections and deep structure. We have compared the performance of DFSMN to BLSTM both with and without lower frame rate (LFR) on several large speech recognition tasks, including English and Mandarin. Experimental results shown that DFSMN can consistently outperform BLSTM with dramatic gain, especially trained with LFR using CD-Phone as modeling units. In the 2000 hours Fisher (FSH) task, the proposed DFSMN can achieve a word error rate of 9.4% by purely using the cross-entropy criterion and decoding with a 3-gram language model, which achieves a 1.5% absolute improvement compared to the BLSTM. In a 20000 hours Mandarin recognition task, the LFR trained DFSMN can achieve more than 20% relative improvement compared to the LFR trained BLSTM. Moreover, we can easily design the lookahead filter order of the memory blocks in DFSMN to control the latency for real-time applications.

研究动机与目标

  • 为解决非常深的前馈序列记忆网络(FSMN)在大规模词汇连续语音识别(LVCSR)中出现的梯度消失和训练不稳定性问题。
  • 通过架构创新,实现比BLSTM等循环模型更深、更稳定的网络结构,以提升性能。
  • 通过在记忆模块中设计可控的前瞻滤波器阶数,实现实时应用中的低延迟推理。
  • 在低帧率(LFR)条件下,对大规模语音识别任务(包括2,000小时英语和20,000小时普通话数据集)评估所提出的DFSMN。

提出的方法

  • 在FSMN相邻层的记忆模块之间引入跳跃连接,以促进信息流动并缓解深层网络中的梯度消失问题。
  • 通过添加具有回溯和前瞻滤波器阶数的可学习FIR类记忆模块,对FSMN架构进行改进,以建模长期时间依赖性。
  • 将DFSMN与低帧率(LFR)处理相结合,以降低计算成本和解码延迟,同时保持识别准确率。
  • 采用带有残差式跳跃连接的深层FSMN堆叠结构,使网络深度增加而性能不下降。
  • 在记忆模块中设计前瞻滤波器阶数,以控制延迟,实现实时部署且性能损失最小。
  • 使用帧级交叉熵损失函数,并在多张GPU上采用分布式优化(BMUF)训练所有模型。

实验结果

研究问题

  • RQ1在像FSMN这样的深层前馈架构中,跳跃连接是否能显著提升大规模LVCSR任务中的训练稳定性和性能?
  • RQ2在大规模语料上使用低帧率(LFR)训练时,DFSMN与BLSTM相比在词错误率(WER)方面表现如何?
  • RQ3与延迟可控的BLSTM(LCBLSTM)相比,DFSMN在保持或提升识别准确率的同时,能在多大程度上降低延迟?
  • RQ4与标准cFSMN相比,DFSMN的更深架构是否能持续带来性能提升而不出现退化?
  • RQ5在相同条件下,DFSMN是否能以更小的模型尺寸和更快的训练速度实现优于BLSTM的性能?

主要发现

  • 在2,000小时英语Fisher(FSH)任务中,DFSMN仅使用交叉熵训练和三元语言模型,即实现9.4%的词错误率(WER),相比BLSTM有1.5%的绝对降低。
  • 在20,000小时普通话识别任务中,LFR训练的DFSMN相比LFR训练的LCBLSTM实现20%以上的相对WER改进,且模型尺寸更小。
  • 具有5帧前瞻延迟(150ms延迟)的DFSMN优于具有40帧延迟(1,200ms延迟)的LCBLSTM,证明其在延迟-性能权衡上的优越性。
  • DFSMN的训练速度约为LCBLSTM的3倍,解码实时因子(RTF)也提升了约3倍。
  • cFSMN在过度加深时(如10层)性能会下降,但得益于跳跃连接,DFSMN在更深架构下仍保持持续性能提升。
  • 所提出的DFSMN架构通过前瞻滤波器阶数实现延迟可控,使其适用于实时应用且不损失准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。