[论文解读] Improving RNN transducer with normalized jointer network
本文提出一种归一化联合网络,以解决RNN-T训练过程中巨大的梯度方差问题,显著提升了收敛速度与性能。通过在编码器和预测器中分别应用因子T和U进行梯度归一化,并结合掩码Conformer编码器与Transformer-XL预测器,该方法在AISHELL-1数据集上取得SOTA结果(5.37% CER),并在30,000小时工业级数据集上相较商用混合系统实现9%的相对性能提升,且无需外部语言模型。
Recurrent neural transducer (RNN-T) is a promising end-to-end (E2E) model in automatic speech recognition (ASR). It has shown superior performance compared to traditional hybrid ASR systems. However, training RNN-T from scratch is still challenging. We observe a huge gradient variance during RNN-T training and suspect it hurts the performance. In this work, we analyze the cause of the huge gradient variance in RNN-T training and proposed a new extit{normalized jointer network} to overcome it. We also propose to enhance the RNN-T network with a modified conformer encoder network and transformer-XL predictor networks to achieve the best performance. Experiments are conducted on the open 170-hour AISHELL-1 and industrial-level 30000-hour mandarin speech dataset. On the AISHELL-1 dataset, our RNN-T system gets state-of-the-art results on AISHELL-1's streaming and non-streaming benchmark with CER 6.15\% and 5.37\% respectively. We further compare our RNN-T system with our well trained commercial hybrid system on 30000-hour-industry audio data and get 9\% relative improvement without pre-training or external language model.
研究动机与目标
- 为解决RNN-T训练过程中巨大的梯度方差问题,该问题阻碍了快速收敛与性能提升。
- 在无需预训练或外部语言模型的前提下,提升RNN-T性能。
- 探究掩码Conformer与Transformer-XL等先进架构在端到端语音识别RNN-T中的有效性。
- 在开源(AISHELL-1)与工业级(30,000小时)普通话ASR基准上均实现SOTA结果。
提出的方法
- 提出一种归一化联合网络,通过因子T(声学长度)与U(转录长度)对梯度进行归一化,以稳定从联合层到编码器与预测器的反向传播。
- 引入具有40个左右上下文掩码的掩码Conformer编码器,以增强编码器中的局部上下文建模能力。
- 采用Transformer-XL预测网络,通过相对位置编码与长距离依赖建模能力,提升自回归语言建模效果。
- 使用Adam优化器、线性热身与指数衰减学习率调度策略,端到端训练RNN-T系统。
- 应用SpecAugment进行数据增强,并在所有组件中使用Dropout(0.1)进行正则化。
- 通过768维投影与Softmax输出优化联合网络,用于后验概率估计。
实验结果
研究问题
- RQ1RNN-T训练中巨大的梯度方差由何引起,其对收敛与性能有何影响?
- RQ2在联合层应用梯度归一化是否能缓解方差并提升训练稳定性?
- RQ3掩码Conformer与Transformer-XL组件如何在无需预训练的情况下提升RNN-T性能?
- RQ4端到端RNN-T系统是否能在大规模工业数据上超越性能优异的商用混合系统?
主要发现
- 所提出的归一化联合网络有效降低了梯度方差,从而实现更快且更稳定的训练,验证损失曲线的改善已得到证实。
- 在AISHELL-1数据集上,最终的RNN-T系统在非流式模式下达到5.37% CER,在流式模式下达到6.15% CER,超越了先前的SOTA结果。
- 参数量为110M的模型(流式大模型)在非流式AISHELL-1上实现5.37% CER,展示了无需外部语言模型即达到SOTA性能。
- 在30,000小时工业级普通话数据集上,RNN-T系统相较一个训练良好的混合系统实现9%的相对性能提升,近场测试集CER为6.14%,远场测试集CER为12.70%。
- 流式基础模型(46M参数)在近场测试集上达到6.80% CER,性能与110M参数的混合系统相当,但模型参数量显著减少。
- 将LSTM预测器替换为Transformer-XL后,CER从6.35%降低至6.18%,证明了先进自回归建模的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。