Skip to main content
QUICK REVIEW

[论文解读] SAN-M: Memory Equipped Self-Attention for End-to-End Speech Recognition

Zhifu Gao, Shiliang Zhang|arXiv (Cornell University)|May 21, 2020
Speech Recognition and Synthesis参考文献 28被引用 9
一句话总结

该论文提出SAN-M,一种配备记忆模块的自注意力机制,通过将自注意力与DFSMM记忆模块融合,提升端到端语音识别中的长距离依赖建模能力。通过在单一子层内以深度融合方式整合这两种组件,SAN-M实现了最先进性能——在AISHELL-1数据集上不依赖外部语言模型,将CER降低至6.46%,并在20,000小时普通话ASR任务中,相对于Transformer基线模型提升超过10%。

ABSTRACT

End-to-end speech recognition has become popular in recent years, since it can integrate the acoustic, pronunciation and language models into a single neural network. Among end-to-end approaches, attention-based methods have emerged as being superior. For example, Transformer, which adopts an encoder-decoder architecture. The key improvement introduced by Transformer is the utilization of self-attention instead of recurrent mechanisms, enabling both encoder and decoder to capture long-range dependencies with lower computational complexity.In this work, we propose boosting the self-attention ability with a DFSMN memory block, forming the proposed memory equipped self-attention (SAN-M) mechanism. Theoretical and empirical comparisons have been made to demonstrate the relevancy and complementarity between self-attention and the DFSMN memory block. Furthermore, the proposed SAN-M provides an efficient mechanism to integrate these two modules. We have evaluated our approach on the public AISHELL-1 benchmark and an industrial-level 20,000-hour Mandarin speech recognition task. On both tasks, SAN-M systems achieved much better performance than the self-attention based Transformer baseline system. Specially, it can achieve a CER of 6.46% on the AISHELL-1 task even without using any external LM, comfortably outperforming other state-of-the-art systems.

研究动机与目标

  • 解决自注意力机制与DFSMM记忆模块在端到端语音识别中建模长距离依赖关系时的局限性。
  • 探索自注意力的全局建模能力与DFSMM的局部、堆叠记忆学习之间的互补性。
  • 设计一种统一且高效的架构,将两种机制整合于单一子层内,以提升性能。
  • 在公开及工业规模的普通话ASR基准上评估所提出的SAN-M机制。
  • 证明SAN-M在不依赖外部语言模型的情况下,仍能达到最先进性能。

提出的方法

  • SAN-M在Transformer编码器和解码器的基本子层内,以深度融合方式整合自注意力与DFSMM记忆模块。
  • 自注意力机制通过输入序列的查询、键和值计算上下文表征,实现全局长距离建模。
  • DFSMM记忆模块通过一系列带时间延迟的前馈层处理序列特征,捕捉局部及分层的长期依赖关系。
  • 自注意力与DFSMM的输出经拼接后进行投影,形成SAN-M子层的最终输出,实现全局与局部模式的联合学习。
  • 模型采用交叉熵损失函数进行端到端训练,结合标签平滑与Dropout正则化。
  • 实验采用LFR特征处理、SpecAugment数据增强,以及使用Noam学习率调度的OpenNMT工具包。

实验结果

研究问题

  • RQ1自注意力与DFSMM记忆模块能否被有效结合,以提升端到端语音识别性能?
  • RQ2自注意力与DFSMM在建模长距离依赖关系方面,是否存在理论与实证上的互补性?
  • RQ3所提出的SAN-M机制是否在大规模普通话ASR任务中优于标准自注意力机制的Transformer?
  • RQ4SAN-M能否在不依赖外部语言模型的情况下实现最先进性能?
  • RQ5模型深度与宽度如何影响SAN-M在长时长及远场语音数据上的性能提升?

主要发现

  • 在AISHELL-1基准上,SAN-M在不使用任何外部语言模型的情况下,实现了6.46%的字符错误率(CER),优于该任务上所有先前的最先进系统。
  • 在AISHELL-1数据集上,SAN-M相对于基于自注意力的Transformer基线模型实现了11.8%的相对误差降低。
  • 在20,000小时工业级普通话ASR任务中,SAN-M在通用集与远场测试集上均实现相对于Transformer基线超过10%的相对误差降低。
  • 性能提升在远场数据上最为显著,表明SAN-M在建模长时长、高挑战性语音序列方面具有更强能力。
  • 更薄更深的SAN-M配置带来了更大的性能增益——在远场数据上实现17%的相对误差降低,且模型参数量增加不足7%。
  • 实证结果证实了自注意力与DFSMM之间的理论互补性,两者在建模长距离依赖关系方面相互增强。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。