[论文解读] end-to-end training of a large vocabulary end-to-end speech recognition system
本文提出了一种基于CPU-GPU集群的可扩展、实时端到端语音识别训练框架,利用声道长度扰动(VTLP)和声学仿真进行数据增强。该系统在LibriSpeech测试集-clean上实现了2.44%的词错误率(WER),在专有的Bixby数据集上实现了7.92%的WER,采用BFA模型并结合浅层融合,展示了在近场和远场场景下的最先进性能。
In this paper, we present an end-to-end training framework for building state-of-the-art end-to-end speech recognition systems. Our training system utilizes a cluster of Central Processing Units(CPUs) and Graphics Processing Units (GPUs). The entire data reading, large scale data augmentation, neural network parameter updates are all performed "on-the-fly". We use vocal tract length perturbation [1] and an acoustic simulator [2] for data augmentation. The processed features and labels are sent to the GPU cluster. The Horovod allreduce approach is employed to train neural network parameters. We evaluated the effectiveness of our system on the standard Librispeech corpus [3] and the 10,000-hr anonymized Bixby English dataset. Our end-to-end speech recognition system built using this training infrastructure showed a 2.44 % WER on test-clean of the LibriSpeech test set after applying shallow fusion with a Transformer language model (LM). For the proprietary English Bixby open domain test set, we obtained a WER of 7.92 % using a Bidirectional Full Attention (BFA) end-to-end model after applying shallow fusion with an RNN-LM. When the monotonic chunckwise attention (MoCha) based approach is employed for streaming speech recognition, we obtained a WER of 9.95 % on the same Bixby open domain test set.
研究动机与目标
- 开发一种可扩展的、分布式的端到端语音识别训练系统,能够处理大规模、多样化的语音数据。
- 通过有效的数据增强技术提升在远场和噪声环境下的鲁棒性。
- 在标准和专有的语音识别基准测试中实现最先进水平的词错误率(WER)。
- 利用CPU-GPU集群实现实时、高效的动态数据增强和模型训练。
- 证明结合VTLP与声学仿真在应对说话人差异和环境变化方面的有效性。
提出的方法
- 系统采用CPU和GPU集群,通过tf.data和分片TFRecords在示例服务器上实时执行数据处理、增强和特征提取。
- 应用声道长度扰动(VTLP)以模拟说话人差异,同时利用声学仿真器生成具有不同房间脉冲响应和噪声条件的远场语音,实现真实感增强。
- 使用Horovod allreduce框架与Adam优化器更新神经网络参数,实现在GPU节点间的高效分布式训练。
- 训练流水线避免预先计算声学仿真参数,而是在训练过程中动态生成,以减少存储需求并提升灵活性。
- 通过与Transformer和RNN语言模型的浅层融合,提升测试集上的解码性能。
- 结合神经波束形成器(NBF)进行信号增强,与数据增强协同使用,进一步提升远场识别准确率。

实验结果
研究问题
- RQ1是否能够通过分布式训练和实时数据增强,使完全端到端的语音识别系统在大规模、多样化语音数据集上实现最先进性能?
- RQ2VTLP与声学仿真在提升对说话人差异和远场声学条件鲁棒性方面的有效性如何?
- RQ3结合数据增强与先进语言模型对降低词错误率的影响是什么?
- RQ4在远场和开放域设置下,端到端模型与传统WFST系统相比性能如何?
- RQ5相同的增强训练数据是否能有效用于近场和远场语音识别而不会导致性能下降?
主要发现
- 采用BFA模型与Transformer语言模型的端到端系统在LibriSpeech测试集-clean上实现了2.44%的WER,优于以往最先进结果。
- 在专有的Bixby开放域测试集上,采用BFA模型并结合与RNN-LM的浅层融合,系统实现了7.92%的WER,相比传统WFST系统相对提升10%。
- 在流式推理场景下,MoChA模型在相同Bixby测试集上实现了9.95%的WER,展现出在实时约束下的优异性能。
- VTLP与声学仿真的结合显著提升了远场条件下的识别准确率,当进一步结合神经波束形成器(NBF)时,性能提升更加明显。
- 实时数据处理流水线在保持干净数据高性能的同时,增强了对噪声和混响的鲁棒性,证明了该方法在不同环境下的通用性。
- 基于Horovod的allreduce训练框架实现了高效的分布式训练,支持在多GPU集群上进行大规模模型优化。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。