[论文解读] Frame Stacking and Retaining for Recurrent Neural Network Acoustic Model
本文提出在解码阶段保留帧的技巧,作为一项解码时技术,以实现在传统单向LSTM声学模型中高效帧堆叠,同时保持与现有WFST解码器的兼容性。通过将N帧堆叠为一个超帧,并在N帧中保留其输出,该方法实现了近乎线性的训练加速,且在无性能下降的情况下将实时因子(RTF)降低41%——在普通话语音数据上,字符错误率(CER)略有改善。
Frame stacking is broadly applied in end-to-end neural network training like connectionist temporal classification (CTC), and it leads to more accurate models and faster decoding. However, it is not well-suited to conventional neural network based on context-dependent state acoustic model, if the decoder is unchanged. In this paper, we propose a novel frame retaining method which is applied in decoding. The system which combined frame retaining with frame stacking could reduces the time consumption of both training and decoding. Long short-term memory (LSTM) recurrent neural networks (RNNs) using it achieve almost linear training speedup and reduces relative 41\% real time factor (RTF). At the same time, recognition performance is no degradation or improves sightly on Shenma voice search dataset in Mandarin.
研究动机与目标
- 为解决帧堆叠与传统RNN解码之间的不兼容性,后者在解码器保持不变时会导致识别性能下降。
- 在无需重新训练解码器或修改HMM结构的前提下,实现在非CTC RNN声学模型中的帧堆叠。
- 在保持或略微提升识别准确率的同时,实现训练与解码阶段的显著加速。
- 在大规模普通话语音识别数据集上,使用单向LSTM模型验证该方法。
提出的方法
- 帧堆叠将N个连续的声学帧合并为一个单一的超帧,使输入序列长度减少N倍。
- 帧保留技术在解码过程中将超帧的输出复制到N个原始帧上,以保持正确的帧级对齐。
- 通过确保输入特征数量与输出帧数量一致,该方法保留了原始的WFST解码器。
- 声学模型使用小批量随机梯度下降(SGD)与动量进行交叉熵训练,随后在大规模普通话数据集上进行sMBR训练。
- 采用基于MPI的去中心化高性能计算(HPC)系统,结合块状模型更新过滤(BMUF)与指数移动平均(EMA),实现高效的分布式训练。
- 模型输入为26维滤波器组特征、2维基频特征及其一阶与二阶差分,输出类别数为11,088个绑定状态。
实验结果
研究问题
- RQ1帧堆叠能否在传统非CTC RNN声学模型中有效应用,而不会导致识别性能下降?
- RQ2在标准WFST解码系统中,帧堆叠对解码速度与实时因子(RTF)有何影响?
- RQ3当帧堆叠减少了输入帧数时,解码阶段的帧保留如何恢复对齐一致性?
- RQ4将帧堆叠与帧保留结合是否能提升识别准确率或速度?其最优的堆叠与保留因子配置为何?
主要发现
- 当与标准解码器配合使用时,仅采用帧堆叠会导致字符错误率(CER)增加415%,表明因建模时长不匹配造成严重性能下降。
- 当帧堆叠(FS=3)与帧保留(FR=3)结合使用时,CER降低至3.81%,相较于基线(3.89%)略有但稳定的改善。
- 当FS与FR均设为3时,实时因子(RTF)相比基线降低41%,实现最快的解码速度。
- 最优配置为FS=3与FR=3,该配置在速度与准确率之间实现了最佳平衡,RTF由0.41降至0.24。
- 由于输入序列长度减少,该方法实现了近乎线性的训练加速,同时保持与现有WFST解码基础设施的兼容性。
- 该方法在大规模普通话语音识别任务中表现有效,词汇量达760,000,使用5-gram语言模型,采用8-GPU分布式训练,结合BMUF与EMA实现模型同步。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。