[论文解读] Improving RNN Transducer Modeling for End-to-End Speech Recognition
本文通过优化训练内存使用以支持更大的小批量(minibatch)并提出新型模型架构,改进了端到端自动语音识别中的RNN Transducer(RNN-T)建模。具体而言,编码器采用新型的ecltGRU(增强上下文长短期记忆门控循环单元),预测网络采用GRU。最佳模型在模型尺寸更小(216 MB)的情况下,相比基线RNN-T实现11.8%的相对词错误率(WER)降低,相比同尺寸的设备级混合模型提升15.0%的相对WER,且性能与一个5.1 GB的大规模服务器级混合模型相当。
In the last few years, an emerging trend in automatic speech recognition research is the study of end-to-end (E2E) systems. Connectionist Temporal Classification (CTC), Attention Encoder-Decoder (AED), and RNN Transducer (RNN-T) are the most popular three methods. Among these three methods, RNN-T has the advantages to do online streaming which is challenging to AED and it doesn't have CTC's frame-independence assumption. In this paper, we improve the RNN-T training in two aspects. First, we optimize the training algorithm of RNN-T to reduce the memory consumption so that we can have larger training minibatch for faster training speed. Second, we propose better model structures so that we obtain RNN-T models with the very good accuracy but small footprint. Trained with 30 thousand hours anonymized and transcribed Microsoft production data, the best RNN-T model with even smaller model size (216 Megabytes) achieves up-to 11.8% relative word error rate (WER) reduction from the baseline RNN-T model. This best RNN-T model is significantly better than the device hybrid model with similar size by achieving up-to 15.0% relative WER reduction, and obtains similar WERs as the server hybrid model of 5120 Megabytes in size.
研究动机与目标
- 降低RNN-T训练期间的内存消耗,以支持更大的小批量和更快的训练速度。
- 设计比基线LSTM-RNN-T更准确且更紧凑的RNN-T模型架构。
- 实现高精度、低资源占用的RNN-T模型,适用于资源受限设备的部署。
- 探究未来上下文前瞻与层轨迹设计对RNN-T性能的影响。
提出的方法
- 重新设计梯度计算方式,避免存储大型中间张量,显著降低RNN-T反向传播过程中的内存使用。
- 提出ecltGRU架构,通过深度和时间LSTM/GRU单元解耦时序建模与分类任务。
- 引入层轨迹(layer trajectory)概念,将分类任务与时序建模分离,提升表征效率。
- 使用可学习投影矩阵U、V和非线性激活函数ψ的联合网络,融合编码器与预测网络的输出。
- 采用帧跳过(跳过因子为2)以降低推理开销,实现20ms输入帧率。
- 在30,000小时匿名化的微软生产数据上进行训练,采用束搜索解码,束宽为10。
实验结果
研究问题
- RQ1内存优化的RNN-T训练是否能支持更大的小批量并实现更快收敛?
- RQ2用ecltGRU等新型架构替代标准LSTM单元,是否能提升RNN-T的准确率与模型效率?
- RQ3编码器中引入未来上下文前瞻,在多大程度上能减少对齐延迟并提升识别性能?
- RQ4所提出的RNN-T模型在准确率与模型大小方面,与同尺寸混合模型相比如何?
主要发现
- 在编码器中使用ecltGRU、预测网络使用GRU的最佳RNN-T模型,相比基线LSTM-RNN-T模型,实现了11.8%的相对词错误率(WER)降低。
- 该最佳模型仅需216 MB存储空间,小于基线RNN-T模型,且相比同尺寸设备级混合模型实现15.0%的相对WER降低。
- 尽管模型规模远小于基线,该RNN-T模型在WER性能上与一个5.12 GB语言模型的大规模服务器级混合模型相当。
- ecltGRU编码器将平均对齐延迟从10个输入帧(300ms)降低至2个输入帧(60ms),结合24帧前瞻,显著提升早期决策能力。
- 内存优化使更大小批量成为可能,加速了训练过程,且未影响模型质量。
- ecltGRU中引入层轨迹与独立的深度/时间单元,相比标准LSTM,实现了更高的准确率与更小的模型尺寸。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。