Skip to main content
QUICK REVIEW

[论文解读] Improving RNN Transducer Modeling for End-to-End Speech Recognition

Jinyu Li, Rui Zhao|arXiv (Cornell University)|Sep 26, 2019
Speech Recognition and Synthesis参考文献 39被引用 5
一句话总结

本文通过优化训练内存使用以支持更大的小批量(minibatch)并提出新型模型架构,改进了端到端自动语音识别中的RNN Transducer(RNN-T)建模。具体而言,编码器采用新型的ecltGRU(增强上下文长短期记忆门控循环单元),预测网络采用GRU。最佳模型在模型尺寸更小(216 MB)的情况下,相比基线RNN-T实现11.8%的相对词错误率(WER)降低,相比同尺寸的设备级混合模型提升15.0%的相对WER,且性能与一个5.1 GB的大规模服务器级混合模型相当。

ABSTRACT

In the last few years, an emerging trend in automatic speech recognition research is the study of end-to-end (E2E) systems. Connectionist Temporal Classification (CTC), Attention Encoder-Decoder (AED), and RNN Transducer (RNN-T) are the most popular three methods. Among these three methods, RNN-T has the advantages to do online streaming which is challenging to AED and it doesn't have CTC's frame-independence assumption. In this paper, we improve the RNN-T training in two aspects. First, we optimize the training algorithm of RNN-T to reduce the memory consumption so that we can have larger training minibatch for faster training speed. Second, we propose better model structures so that we obtain RNN-T models with the very good accuracy but small footprint. Trained with 30 thousand hours anonymized and transcribed Microsoft production data, the best RNN-T model with even smaller model size (216 Megabytes) achieves up-to 11.8% relative word error rate (WER) reduction from the baseline RNN-T model. This best RNN-T model is significantly better than the device hybrid model with similar size by achieving up-to 15.0% relative WER reduction, and obtains similar WERs as the server hybrid model of 5120 Megabytes in size.

研究动机与目标

  • 降低RNN-T训练期间的内存消耗,以支持更大的小批量和更快的训练速度。
  • 设计比基线LSTM-RNN-T更准确且更紧凑的RNN-T模型架构。
  • 实现高精度、低资源占用的RNN-T模型,适用于资源受限设备的部署。
  • 探究未来上下文前瞻与层轨迹设计对RNN-T性能的影响。

提出的方法

  • 重新设计梯度计算方式,避免存储大型中间张量,显著降低RNN-T反向传播过程中的内存使用。
  • 提出ecltGRU架构,通过深度和时间LSTM/GRU单元解耦时序建模与分类任务。
  • 引入层轨迹(layer trajectory)概念,将分类任务与时序建模分离,提升表征效率。
  • 使用可学习投影矩阵U、V和非线性激活函数ψ的联合网络,融合编码器与预测网络的输出。
  • 采用帧跳过(跳过因子为2)以降低推理开销,实现20ms输入帧率。
  • 在30,000小时匿名化的微软生产数据上进行训练,采用束搜索解码,束宽为10。

实验结果

研究问题

  • RQ1内存优化的RNN-T训练是否能支持更大的小批量并实现更快收敛?
  • RQ2用ecltGRU等新型架构替代标准LSTM单元,是否能提升RNN-T的准确率与模型效率?
  • RQ3编码器中引入未来上下文前瞻,在多大程度上能减少对齐延迟并提升识别性能?
  • RQ4所提出的RNN-T模型在准确率与模型大小方面,与同尺寸混合模型相比如何?

主要发现

  • 在编码器中使用ecltGRU、预测网络使用GRU的最佳RNN-T模型,相比基线LSTM-RNN-T模型,实现了11.8%的相对词错误率(WER)降低。
  • 该最佳模型仅需216 MB存储空间,小于基线RNN-T模型,且相比同尺寸设备级混合模型实现15.0%的相对WER降低。
  • 尽管模型规模远小于基线,该RNN-T模型在WER性能上与一个5.12 GB语言模型的大规模服务器级混合模型相当。
  • ecltGRU编码器将平均对齐延迟从10个输入帧(300ms)降低至2个输入帧(60ms),结合24帧前瞻,显著提升早期决策能力。
  • 内存优化使更大小批量成为可能,加速了训练过程,且未影响模型质量。
  • ecltGRU中引入层轨迹与独立的深度/时间单元,相比标准LSTM,实现了更高的准确率与更小的模型尺寸。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。