Skip to main content
QUICK REVIEW

[论文解读] Exploring RNN-Transducer for Chinese Speech Recognition

Senmao Wang, Pan Zhou|arXiv (Cornell University)|Nov 13, 2018
Speech Recognition and Synthesis参考文献 16被引用 6
一句话总结

本文提出了一种针对普通话大词汇量连续语音识别(LVCSR)中RNN-Transducer(RNN-T)的简化训练流程,通过引入卷积层、优化学习率衰减与下采样策略,消除了对预训练的需求。在1,000小时语料上,该方法实现了16.9%的字符错误率(CER),相比强 baseline的BLSTM CE系统绝对提升了2%,表明端到端的RNN-T在极简架构下仍可超越传统系统。

ABSTRACT

End-to-end approaches have drawn much attention recently for significantly simplifying the construction of an automatic speech recognition (ASR) system. RNN transducer (RNN-T) is one of the popular end-to-end methods. Previous studies have shown that RNN-T is difficult to train and a very complex training process is needed for a reasonable performance. In this paper, we explore RNN-T for a Chinese large vocabulary continuous speech recognition (LVCSR) task and aim to simplify the training process while maintaining performance. First, a new strategy of learning rate decay is proposed to accelerate the model convergence. Second, we find that adding convolutional layers at the beginning of the network and using ordered data can discard the pre-training process of the encoder without loss of performance. Besides, we design experiments to find a balance among the usage of GPU memory, training circle and model performance. Finally, we achieve 16.9% character error rate (CER) on our test set which is 2% absolute improvement from a strong BLSTM CE system with language model trained on the same text corpus.

研究动机与目标

  • 简化通常用于普通话LVCSR中RNN-Transducer所需的复杂多阶段训练流程。
  • 通过引入卷积层与替代初始化策略,消除对CTC模型进行预训练的需求。
  • 通过学习率衰减、下采样与批量大小管理,优化训练效率。
  • 评估语言模型初始化与下采样对模型性能及GPU显存占用的影响。

提出的方法

  • 提出一种尖锐的学习率衰减策略:在损失开始上升后,每训练一个周期将学习率减半,从而加速收敛。
  • 在BLSTM编码器前引入卷积层,以替代依赖CTC模型的预训练需求。
  • 通过最大池化与金字塔BLSTM层实现下采样,降低GPU显存占用并加快训练速度。
  • 使用在转录文本上训练的字符级LSTM语言模型来初始化预测网络,提升模型性能。
  • 对比不同下采样配置(位置与速率),以在速度、显存与准确率之间取得平衡。
  • 将所有优化策略整合至单一RNN-T模型中,实现从零开始端到端训练,避免预训练与外部CTC初始化。

实验结果

研究问题

  • RQ1能否通过去除CTC模型预训练阶段来简化RNN-T的训练流程?
  • RQ2在BLSTM编码器前添加卷积层对性能与训练复杂度有何影响?
  • RQ3何种学习率衰减策略最有效地加速普通话ASR中RNN-T的收敛?
  • RQ4下采样对GPU显存占用、训练速度与模型准确率有何影响?
  • RQ5在不进行预训练的前提下,使用语言模型初始化预测网络是否能提升性能?

主要发现

  • 所提出的损失上升后学习率减半的衰减策略显著加速了模型收敛,并提升了训练稳定性。
  • 在BLSTM编码器前引入卷积层可完全消除对CTC预训练的需求,且性能无损失。
  • 通过金字塔BLSTM实现总下采样率4–6时,可在训练速度、显存占用与准确率之间取得最佳平衡。
  • 使用相同转录数据训练的语言模型初始化预测网络,性能优于使用外部语料训练的模型。
  • 最终的RNN-T模型在1,000小时普通话语料上达到16.9%的CER,相比强基线BLSTM CE系统(含语言模型)绝对提升2%。
  • 在10,000小时语料上,RNN-T模型未使用外部语言模型即达到10.52%的CER,优于延迟可控的BLSTM系统(11.30% CER)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。