Skip to main content
QUICK REVIEW

[论文解读] On the Comparison of Popular End-to-End Models for Large Scale Speech Recognition

Jinyu Li, Yu Wu|arXiv (Cornell University)|May 28, 2020
Speech Recognition and Synthesis参考文献 38被引用 17
一句话总结

本文基于65,000小时的匿名微软语音数据,对RNN-T、RNN-AED和Transformer-AED模型进行了大规模的实证比较,评估了流式与非流式推理模式。结果表明,Transformer-AED在两种模式下均实现了最佳准确率;而CE初始化和上下文建模显著提升了RNN-T的性能,使其超越了高度优化的混合模型。

ABSTRACT

Recently, there has been a strong push to transition from hybrid models to end-to-end (E2E) models for automatic speech recognition. Currently, there are three promising E2E methods: recurrent neural network transducer (RNN-T), RNN attention-based encoder-decoder (AED), and Transformer-AED. In this study, we conduct an empirical comparison of RNN-T, RNN-AED, and Transformer-AED models, in both non-streaming and streaming modes. We use 65 thousand hours of Microsoft anonymized training data to train these models. As E2E models are more data hungry, it is better to compare their effectiveness with large amount of training data. To the best of our knowledge, no such comprehensive study has been conducted yet. We show that although AED models are stronger than RNN-T in the non-streaming mode, RNN-T is very competitive in streaming mode if its encoder can be properly initialized. Among all three E2E models, transformer-AED achieved the best accuracy in both streaming and non-streaming mode. We show that both streaming RNN-T and transformer-AED models can obtain better accuracy than a highly-optimized hybrid model.

研究动机与目标

  • 在真实工业条件下,对当前最主流的端到端自动语音识别模型——RNN-T、RNN-AED和Transformer-AED——开展大规模、全面的实证比较。
  • 利用大规模65,000小时数据集,评估模型在流式与非流式推理模式下的性能表现。
  • 研究编码器初始化方式(CE与CTC)以及前瞻上下文建模对RNN-T与Transformer-AED性能的影响。
  • 确定单一流式端到端模型是否能够超越高度优化的混合自动语音识别系统。
  • 发布可复现的Transformer-AED代码,以支持未来研究。

提出的方法

  • 在65,000小时的匿名微软语音数据上训练RNN-T、RNN-AED和Transformer-AED模型,采用共享的编码器架构以确保公平比较。
  • 提出一种多层上下文建模方案,将前瞻帧在所有编码器块中平均分配,以提升未来上下文的利用效率。
  • 为RNN-T编码器引入交叉熵(CE)初始化方法,该方法改善了对齐学习,与随机初始化相比,相对降低了8.0%的WER。
  • 为流式Transformer-AED实现两种前瞻策略:基于每块的未来上下文方法与基于固定大小未来上下文窗口的分块方法。
  • 采用定制的LSTM单元,结合内部投影与层归一化,以在保持模型规模的同时提升内存容量。
  • 应用词粒度持续时间分割方法,在缺乏语音对齐信息时,近似时间对齐以用于CE预训练。

实验结果

研究问题

  • RQ1在大规模数据集上,RNN-T、RNN-AED与Transformer-AED在流式与非流式推理模式下的WER性能表现如何比较?
  • RQ2与CTC初始化相比,CE初始化对RNN-T模型性能的影响如何,特别是在流式设置下?
  • RQ3对于流式Transformer-AED模型,前瞻式与分块式未来上下文整合方法中,哪种方法性能更优?
  • RQ4单一流式端到端模型是否能够在准确率上超越高度优化的混合自动语音识别系统?
  • RQ5相较于单层前瞻或卷积式前瞻,多层上下文建模在降低WER方面提升了多少?

主要发现

  • Transformer-AED在流式模式下实现了最低的WER(9.16%),并在所有测试集上均优于RNN-T与RNN-AED。
  • 采用CE初始化与多层上下文建模的RNN-T实现了9.27%的WER,显著优于标准RNN-T,甚至超越了最佳RNN-AED模型。
  • Transformer-AED采用分块式未来上下文整合方法,相比前瞻方法,相对降低了10.7%的WER,表明其在利用未来上下文方面更具优势。
  • CE初始化使RNN-T的WER相比随机初始化相对降低了8.0%,表明即使在大规模场景下,使用对齐感知目标进行预训练仍具有显著优势。
  • 流式RNN-T(9.27%)与流式Transformer-AED(9.16%)的准确率均优于高度优化的混合模型,证明了现代端到端方法的优越性。
  • 所提出的多层上下文建模方案通过更有效地在所有编码器块中分配前瞻帧,优于基于前瞻卷积的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。