[论文解读] SAN-M: Memory Equipped Self-Attention for End-to-End Speech Recognition
该论文提出SAN-M,一种配备记忆模块的自注意力机制,通过将自注意力与DFSMM记忆模块融合,提升端到端语音识别中的长距离依赖建模能力。通过在单一子层内以深度融合方式整合这两种组件,SAN-M实现了最先进性能——在AISHELL-1数据集上不依赖外部语言模型,将CER降低至6.46%,并在20,000小时普通话ASR任务中,相对于Transformer基线模型提升超过10%。
End-to-end speech recognition has become popular in recent years, since it can integrate the acoustic, pronunciation and language models into a single neural network. Among end-to-end approaches, attention-based methods have emerged as being superior. For example, Transformer, which adopts an encoder-decoder architecture. The key improvement introduced by Transformer is the utilization of self-attention instead of recurrent mechanisms, enabling both encoder and decoder to capture long-range dependencies with lower computational complexity.In this work, we propose boosting the self-attention ability with a DFSMN memory block, forming the proposed memory equipped self-attention (SAN-M) mechanism. Theoretical and empirical comparisons have been made to demonstrate the relevancy and complementarity between self-attention and the DFSMN memory block. Furthermore, the proposed SAN-M provides an efficient mechanism to integrate these two modules. We have evaluated our approach on the public AISHELL-1 benchmark and an industrial-level 20,000-hour Mandarin speech recognition task. On both tasks, SAN-M systems achieved much better performance than the self-attention based Transformer baseline system. Specially, it can achieve a CER of 6.46% on the AISHELL-1 task even without using any external LM, comfortably outperforming other state-of-the-art systems.
研究动机与目标
- 解决自注意力机制与DFSMM记忆模块在端到端语音识别中建模长距离依赖关系时的局限性。
- 探索自注意力的全局建模能力与DFSMM的局部、堆叠记忆学习之间的互补性。
- 设计一种统一且高效的架构,将两种机制整合于单一子层内,以提升性能。
- 在公开及工业规模的普通话ASR基准上评估所提出的SAN-M机制。
- 证明SAN-M在不依赖外部语言模型的情况下,仍能达到最先进性能。
提出的方法
- SAN-M在Transformer编码器和解码器的基本子层内,以深度融合方式整合自注意力与DFSMM记忆模块。
- 自注意力机制通过输入序列的查询、键和值计算上下文表征,实现全局长距离建模。
- DFSMM记忆模块通过一系列带时间延迟的前馈层处理序列特征,捕捉局部及分层的长期依赖关系。
- 自注意力与DFSMM的输出经拼接后进行投影,形成SAN-M子层的最终输出,实现全局与局部模式的联合学习。
- 模型采用交叉熵损失函数进行端到端训练,结合标签平滑与Dropout正则化。
- 实验采用LFR特征处理、SpecAugment数据增强,以及使用Noam学习率调度的OpenNMT工具包。
实验结果
研究问题
- RQ1自注意力与DFSMM记忆模块能否被有效结合,以提升端到端语音识别性能?
- RQ2自注意力与DFSMM在建模长距离依赖关系方面,是否存在理论与实证上的互补性?
- RQ3所提出的SAN-M机制是否在大规模普通话ASR任务中优于标准自注意力机制的Transformer?
- RQ4SAN-M能否在不依赖外部语言模型的情况下实现最先进性能?
- RQ5模型深度与宽度如何影响SAN-M在长时长及远场语音数据上的性能提升?
主要发现
- 在AISHELL-1基准上,SAN-M在不使用任何外部语言模型的情况下,实现了6.46%的字符错误率(CER),优于该任务上所有先前的最先进系统。
- 在AISHELL-1数据集上,SAN-M相对于基于自注意力的Transformer基线模型实现了11.8%的相对误差降低。
- 在20,000小时工业级普通话ASR任务中,SAN-M在通用集与远场测试集上均实现相对于Transformer基线超过10%的相对误差降低。
- 性能提升在远场数据上最为显著,表明SAN-M在建模长时长、高挑战性语音序列方面具有更强能力。
- 更薄更深的SAN-M配置带来了更大的性能增益——在远场数据上实现17%的相对误差降低,且模型参数量增加不足7%。
- 实证结果证实了自注意力与DFSMM之间的理论互补性,两者在建模长距离依赖关系方面相互增强。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。