Skip to main content
QUICK REVIEW

[论文解读] Improving RNN transducer with normalized jointer network

Mingkun Huang, Jun Zhang|arXiv (Cornell University)|Nov 3, 2020
Speech Recognition and Synthesis参考文献 26被引用 5
一句话总结

本文提出一种归一化联合网络,以解决RNN-T训练过程中巨大的梯度方差问题,显著提升了收敛速度与性能。通过在编码器和预测器中分别应用因子T和U进行梯度归一化,并结合掩码Conformer编码器与Transformer-XL预测器,该方法在AISHELL-1数据集上取得SOTA结果(5.37% CER),并在30,000小时工业级数据集上相较商用混合系统实现9%的相对性能提升,且无需外部语言模型。

ABSTRACT

Recurrent neural transducer (RNN-T) is a promising end-to-end (E2E) model in automatic speech recognition (ASR). It has shown superior performance compared to traditional hybrid ASR systems. However, training RNN-T from scratch is still challenging. We observe a huge gradient variance during RNN-T training and suspect it hurts the performance. In this work, we analyze the cause of the huge gradient variance in RNN-T training and proposed a new extit{normalized jointer network} to overcome it. We also propose to enhance the RNN-T network with a modified conformer encoder network and transformer-XL predictor networks to achieve the best performance. Experiments are conducted on the open 170-hour AISHELL-1 and industrial-level 30000-hour mandarin speech dataset. On the AISHELL-1 dataset, our RNN-T system gets state-of-the-art results on AISHELL-1's streaming and non-streaming benchmark with CER 6.15\% and 5.37\% respectively. We further compare our RNN-T system with our well trained commercial hybrid system on 30000-hour-industry audio data and get 9\% relative improvement without pre-training or external language model.

研究动机与目标

  • 为解决RNN-T训练过程中巨大的梯度方差问题,该问题阻碍了快速收敛与性能提升。
  • 在无需预训练或外部语言模型的前提下,提升RNN-T性能。
  • 探究掩码Conformer与Transformer-XL等先进架构在端到端语音识别RNN-T中的有效性。
  • 在开源(AISHELL-1)与工业级(30,000小时)普通话ASR基准上均实现SOTA结果。

提出的方法

  • 提出一种归一化联合网络,通过因子T(声学长度)与U(转录长度)对梯度进行归一化,以稳定从联合层到编码器与预测器的反向传播。
  • 引入具有40个左右上下文掩码的掩码Conformer编码器,以增强编码器中的局部上下文建模能力。
  • 采用Transformer-XL预测网络,通过相对位置编码与长距离依赖建模能力,提升自回归语言建模效果。
  • 使用Adam优化器、线性热身与指数衰减学习率调度策略,端到端训练RNN-T系统。
  • 应用SpecAugment进行数据增强,并在所有组件中使用Dropout(0.1)进行正则化。
  • 通过768维投影与Softmax输出优化联合网络,用于后验概率估计。

实验结果

研究问题

  • RQ1RNN-T训练中巨大的梯度方差由何引起,其对收敛与性能有何影响?
  • RQ2在联合层应用梯度归一化是否能缓解方差并提升训练稳定性?
  • RQ3掩码Conformer与Transformer-XL组件如何在无需预训练的情况下提升RNN-T性能?
  • RQ4端到端RNN-T系统是否能在大规模工业数据上超越性能优异的商用混合系统?

主要发现

  • 所提出的归一化联合网络有效降低了梯度方差,从而实现更快且更稳定的训练,验证损失曲线的改善已得到证实。
  • 在AISHELL-1数据集上,最终的RNN-T系统在非流式模式下达到5.37% CER,在流式模式下达到6.15% CER,超越了先前的SOTA结果。
  • 参数量为110M的模型(流式大模型)在非流式AISHELL-1上实现5.37% CER,展示了无需外部语言模型即达到SOTA性能。
  • 在30,000小时工业级普通话数据集上,RNN-T系统相较一个训练良好的混合系统实现9%的相对性能提升,近场测试集CER为6.14%,远场测试集CER为12.70%。
  • 流式基础模型(46M参数)在近场测试集上达到6.80% CER,性能与110M参数的混合系统相当,但模型参数量显著减少。
  • 将LSTM预测器替换为Transformer-XL后,CER从6.35%降低至6.18%,证明了先进自回归建模的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。