Skip to main content
QUICK REVIEW

[论文解读] Exponential Moving Average Model in Parallel Speech Recognition Training

Xu Tian, Jun Zhang|arXiv (Cornell University)|Mar 3, 2017
Natural Language Processing Techniques参考文献 12被引用 3
一句话总结

本论文提出了一种非干扰性指数移动平均(EMA)方法,用于在多GPU集群上进行大规模并行语音识别训练。通过在同步训练过程中维护一个EMA模型(而不将其广播给工作节点),该方法在不增加通信开销的前提下实现了更优的性能表现——在深度神经网络中,与基线BMUF相比,普通话语音识别字符错误率(CER)降低了3.9%,与单GPU训练相比降低了8.4%;同时实现了接近线性的加速比,并在收敛稳定性方面优于标准模型平均方法。

ABSTRACT

As training data rapid growth, large-scale parallel training with multi-GPUs cluster is widely applied in the neural network model learning currently.We present a new approach that applies exponential moving average method in large-scale parallel training of neural network model. It is a non-interference strategy that the exponential moving average model is not broadcasted to distributed workers to update their local models after model synchronization in the training process, and it is implemented as the final model of the training system. Fully-connected feed-forward neural networks (DNNs) and deep unidirectional Long short-term memory (LSTM) recurrent neural networks (RNNs) are successfully trained with proposed method for large vocabulary continuous speech recognition on Shenma voice search data in Mandarin. The character error rate (CER) of Mandarin speech recognition further degrades than state-of-the-art approaches of parallel training.

研究动机与目标

  • 为解决深度神经网络在语音识别中大规模并行训练时收敛速度慢和性能下降的问题。
  • 在不增加通信开销的前提下,提升多GPU分布式训练中的模型泛化能力和测试准确率。
  • 探究指数移动平均(EMA)作为同步、去中心化并行训练中最终模型估计器的有效性。
  • 在大词汇量连续语音识别(LVCSR)中,实现优于模型平均和基线BMUF方法的性能表现。

提出的方法

  • 在同步多GPU训练过程中应用指数移动平均(EMA)以维护全局模型估计,仅在参数服务器上更新,不向工作节点广播。
  • 采用标准EMA更新规则:$ \bar{\theta}_{t} = \alpha \bar{\theta}_{t-1} + (1 - \alpha) \theta_t $,其中 $ \theta_t $ 表示步骤 $ t $ 的同步模型。
  • 在8个GPU之间实现去中心化、对等通信机制,避免集中式参数服务器的瓶颈,最大化GPU利用率。
  • 采用帧堆叠(3帧)技术,在保留时间上下文信息的同时减少计算量和训练时间。
  • 在沈麻普通话语音搜索数据上,使用EMA作为最终模型,对DNN和单向LSTM模型进行训练,且不修改本地工作节点的参数更新策略。
  • 使用验证集FAR和测试集CER评估性能,最终基于解码结果选择EMA作为最终模型。

实验结果

研究问题

  • RQ1EMA是否能在不干扰工作节点更新的前提下,提升大规模并行语音识别训练中的泛化能力和测试准确率?
  • RQ2在LVCSR中,EMA与模型平均(MA)和BMUF相比,在收敛稳定性和最终CER方面表现如何?
  • RQ3EMA在普通话语音识别中对DNN和LSTM等不同架构是否均能提供一致的性能增益?
  • RQ4EMA是否能在保持或提升模型准确率的同时,实现接近线性的加速比,相比单GPU训练?

主要发现

  • 对于LSTM模型,EMA方法在测试集上相比BMUF基线实现了3.9%的相对CER降低。
  • 对于8层DNN,EMA方法相比基线CER降低了8.4%,在更深的网络架构中展现出显著优势。
  • EMA在最终CER方面优于BMUF和模型平均(MA),而MA表现出不稳定的性能,有时甚至超过BMUF。
  • EMA模型在所有训练周期中均持续保持低于MA的CER,表明其在模型选择方面具有更高的稳定性和可靠性。
  • 帧堆叠显著减少了计算量和训练时间,实现了高效的大规模训练,且开销极小。
  • 采用对等通信的去中心化训练架构最大化了GPU利用率,并避免了同步过程中的空闲时间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。