[论文解读] DFSMN-SAN with Persistent Memory Model for Automatic Speech Recognition
本文提出一种带有持久记忆的DFSMM-SAN模型,用于自动语音识别(ASR),通过结合深度前馈序列记忆网络(DFSMN)与自注意力网络(SAN),提升长上下文建模能力。该工作引入两种持久记忆结构——键值记忆与输入嵌入记忆,使大规模LVCSR任务中的基线模型相对CER降低达11%。
Self-attention networks (SAN) have been introduced into automatic speech recognition (ASR) and achieved state-of-the-art performance owing to its superior ability in capturing long term dependency. One of the key ingredients is the self-attention mechanism which can be effectively performed on the whole utterance level. In this paper, we try to investigate whether even more information beyond the whole utterance level can be exploited and beneficial. We propose to apply self-attention layer with augmented memory to ASR. Specifically, we first propose a variant model architecture which combines deep feed-forward sequential memory network (DFSMN) with self-attention layers to form a better baseline model compared with a purely self-attention network. Then, we propose and compare two kinds of additional memory structures added into self-attention layers. Experiments on large-scale LVCSR tasks show that on four individual test sets, the DFSMN-SAN architecture outperforms vanilla SAN encoder by 5% relatively in character error rate (CER). More importantly, the additional memory structure provides further 5% to 11% relative improvement in CER.
研究动机与目标
- 通过结合DFSMN与自注意力网络(SAN)以改善长期依赖性建模,从而提升自动语音识别(ASR)性能。
- 探究是否在完整话语上下文之外的信息可进一步提升ASR准确率。
- 设计并评估新型持久记忆结构,以独立于输入序列的方式存储全局上下文。
- 比较键值记忆与输入嵌入记忆在提升ASR性能方面的有效性,同时实现参数增加最小化。
- 在使用真实世界语音数据的大规模多样化测试集上,验证所提出的架构与记忆机制的有效性。
提出的方法
- 提出一种混合模型架构DFSMM-SAN,将30层DFSMN与3个多头自注意力子层结合,以在效率与长距离依赖建模之间取得平衡。
- 通过在自注意力层中引入可学习的键值向量,增强持久记忆机制,使全局上下文信息独立于输入序列存储。
- 提出一种改进的输入嵌入记忆结构,使记忆向量与输入嵌入共享,从而在保持性能的同时减小模型规模。
- 采用多头自注意力机制,结合缩放点积注意力、残差连接、层归一化与Dropout,以实现稳定训练。
- 使用CTC损失并配合梯度裁剪,利用Kaldi工具包在8块Tesla P40 GPU上通过BMUF优化进行模型训练。
- 在四个测试集(Read、Chat、Spon和AISHELL)上评估两种记忆结构,以字符错误率(CER)为主要评价指标。
实验结果
研究问题
- RQ1与纯SAN或纯DFSMN模型相比,结合DFSMN与自注意力层是否能提升ASR性能?
- RQ2在话语级上下文之外引入持久记忆是否能带来可测量的ASR准确率提升?
- RQ3在性能与参数效率方面,不同持久记忆结构(键值记忆 vs. 输入嵌入记忆)的对比如何?
- RQ4持久记忆带来的性能增益是否在具有不同语音特征的多样化测试集上均具有鲁棒性?
- RQ5在仅使用少量自注意力层的情况下,混合DFSMM-SAN架构是否能以更低计算成本超越完整SAN编码器?
主要发现
- DFSMM-SAN模型在Read测试集上相较纯DFSMN与纯SAN模型均有更优表现,实现34.4%的相对CER降低。
- 在DFSMM-SAN模型中加入持久记忆后,所有测试集的相对CER均进一步降低5%至11%。
- 在AISHELL测试集上,键值记忆结构相较基线实现9.5%的相对CER降低。
- 所提出的输入嵌入记忆结构在参数更少的情况下实现与键值记忆相近的性能,更具紧凑性。
- 持久记忆向量数量(64、128、256)对性能影响极小,表明在此范围内向量数量具有鲁棒性。
- 所有实验均基于超过10,000小时的训练数据完成,且在四个不同测试集上结果一致,验证了模型的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。