[论文解读] Attention-based Transducer for Online Speech Recognition
本文提出一种基于注意力的转换器,通过在联合网络中引入分块注意力以及在编码器中引入自注意力机制,提升了RNN-T在在线语音识别中的性能,相较于基线RNN-T在500小时数据上实现1.7倍的训练加速和10.6%的相对WER降低;在10,000小时数据上,相比Kaldi的TDNN-f系统实现5.5%的相对WER改进。
Recent studies reveal the potential of recurrent neural network transducer (RNN-T) for end-to-end (E2E) speech recognition. Among some most popular E2E systems including RNN-T, Attention Encoder-Decoder (AED), and Connectionist Temporal Classification (CTC), RNN-T has some clear advantages given that it supports streaming recognition and does not have frame-independency assumption. Although significant progresses have been made for RNN-T research, it is still facing performance challenges in terms of training speed and accuracy. We propose attention-based transducer with modification over RNN-T in two aspects. First, we introduce chunk-wise attention in the joint network. Second, self-attention is introduced in the encoder. Our proposed model outperforms RNN-T for both training speed and accuracy. For training, we achieves over 1.7x speedup. With 500 hours LAIX non-native English training data, attention-based transducer yields ~10.6% WER reduction over baseline RNN-T. Trained with full set of over 10K hours data, our final system achieves ~5.5% WER reduction over that trained with the best Kaldi TDNN-f recipe. After 8-bit weight quantization without WER degradation, RTF and latency drop to 0.34~0.36 and 268~409 milliseconds respectively on a single CPU core of a production server.
研究动机与目标
- 解决RNN-T训练中的标签不平衡问题,即由于输入序列长而输出序列短,导致空白符号占主导地位。
- 提升RNN-T的训练速度,因其受前向-后向算法高内存与计算成本影响,训练速度慢于AED与CTC。
- 通过在联合网络中采用分块注意力缩小对齐网格大小,降低RNN-T的延迟与内存占用。
- 通过在编码器中引入自注意力机制增强上下文建模能力,提升识别准确率,同时不牺牲流式处理能力。
- 在大规模L2英语语音数据上实现最先进性能,同时保持适合生产部署的低延迟特性。
提出的方法
- 在联合网络中引入分块注意力机制,使预测网络仅关注编码器输出的固定大小分块,而非完整序列,从而减小网格大小与计算成本。
- 在编码器中应用自注意力机制,以建模长距离依赖关系并改善上下文表征,提升识别准确率。
- 在编码器中采用下采样策略,降低时间分辨率,进一步缓解输出单元与空白符号之间的标签不平衡问题。
- 通过利用分块注意力带来的更小网格大小,采用大批次训练模型,实现更快的训练收敛速度。
- 使用LAS模型对编码器进行预训练,以在微调完整注意力转换器前获得更优的初始表征学习。
- 通过TFLite实现8位权重量化,减小模型大小并加速推理,在单核CPU上实现低延迟。
实验结果
研究问题
- RQ1联合网络中的分块注意力是否能缩小对齐网格大小,从而提升RNN-T的训练效率?
- RQ2在编码器中引入自注意力机制是否能在不增加延迟的前提下提升RNN-T的识别准确率?
- RQ3分块注意力与下采样在多大程度上可缓解RNN-T中输出单元与空白符号之间的标签不平衡问题?
- RQ4所提出的注意力转换器是否能在大规模L2英语语音数据上实现优于传统RNN-T与Kaldi的TDNN-f系统的WER表现?
- RQ5在流式推理中,使用不同上下文长度与分块宽度时,延迟、实时因子(RTF)与WER之间存在何种权衡?
主要发现
- 由于分块注意力带来的网格大小减小与更大批次训练的支持,基于注意力的转换器相比基线RNN-T实现超过1.7倍的训练加速。
- 在500小时的LAIX L2英语数据上,该模型相较基线RNN-T实现10.6%的相对WER降低,相较LAS模型实现14.4%的相对WER降低。
- 在超过10,000小时的训练数据下,最终系统相较使用3-gram语言模型的Kaldi TDNN-f系统实现5.5%的相对WER降低。
- 经过8位权重量化后,模型在保持WER性能的同时,实现实时因子(RTF)0.34–0.36,单核CPU上的延迟为268–409毫秒。
- 当使用较小的上下文长度(τ=2)时,延迟降低至300毫秒,表明其具备适用于实时部署的低延迟推理能力。
- 与基线RNN-T相比,该模型将删除错误减少了约30%,表明分块注意力有效改善了标签不平衡问题的处理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。