Skip to main content
QUICK REVIEW

[论文解读] Thank you for Attention: A survey on Attention-based Artificial Neural Networks for Automatic Speech Recognition

Priyabrata Karmakar, Shyh Wei Teng|arXiv (Cornell University)|Feb 14, 2021
Speech Recognition and Synthesis参考文献 76被引用 11
一句话总结

本综述对自动语音识别(ASR)中基于注意力机制的神经网络进行了全面分析,涵盖基于RNN和Transformer的离线与流式ASR架构。它详细阐述了全局注意力、局部注意力、内容相关注意力、位置相关注意力以及混合注意力机制的演进,并探讨了适用于流式处理的改进方法,如分块流(chunk-flow)、时间受限自注意力和单调注意力,以实现实时推理同时保持性能。

ABSTRACT

Attention is a very popular and effective mechanism in artificial neural network-based sequence-to-sequence models. In this survey paper, a comprehensive review of the different attention models used in developing automatic speech recognition systems is provided. The paper focuses on the development and evolution of attention models for offline and streaming speech recognition within recurrent neural network- and Transformer- based architectures.

研究动机与目标

  • 提供端到端自动语音识别(ASR)系统中注意力机制的系统性综述。
  • 分析基于循环神经网络(RNN)和Transformer的ASR架构中注意力模型的演进过程。
  • 研究利用注意力机制实现流式ASR的技术,包括分块处理和注意力范围限制。
  • 识别在线ASR中的挑战,如对齐学习效率低下和注意力头冗余,并综述相关解决方案。
  • 通过聚焦且全面的ASR中注意力机制综述,弥合现有文献的空白,与更广泛的NLP综述形成区分。

提出的方法

  • 根据注意力计算方式和作用范围,将注意力机制分类为全局/软性、局部/硬性、内容相关、位置相关以及混合类型。
  • 解释自注意力在基于Transformer的ASR中的作用,取代循环结构,实现序列的并行处理。
  • 详细说明流式处理的改进方法,如分块流机制(公式21),其将自注意力限制在固定长度的输入窗口内(例如,Nl=20,Nr=10)。
  • 描述时间受限自注意力机制,其将注意力范围限制在左侧和右侧各固定帧数(例如,15帧和6帧),以实现实时推理。
  • 介绍同步Transformer和单调截断注意力机制,其中注意力仅限于左文上下文,并以分块方式处理。
  • 引入HeadDrop正则化与剪枝技术,通过屏蔽冗余注意力头并强制有效学习,提升单调多头注意力(MMA)中的对齐学习效果。

实验结果

研究问题

  • RQ1不同类型的注意力机制(全局、局部、内容相关、位置相关、混合)在基于RNN和Transformer的ASR模型中是如何演进并被应用的?
  • RQ2为适应流式(在线)语音识别,注意力机制在架构和训练方面需要哪些关键修改?
  • RQ3分块流、时间受限注意力和单调注意力等技术如何实现实时ASR同时保持性能?
  • RQ4在多头注意力的在线ASR中会遇到哪些挑战?HeadDrop和剪枝等方法如何解决这些问题?
  • RQ5Transformer中的自注意力机制如何克服序列建模中循环结构的局限性以应用于ASR?

主要发现

  • 分块流机制将自注意力限制在固定窗口内(例如,左侧20帧,右侧10帧),在上下文受限的情况下仍能实现可接受性能的流式推理。
  • 时间受限自注意力机制将注意力范围限制在左侧15帧和右侧6帧,实现了极低性能损失的实时推理。
  • 单调多头注意力(MMA)通过将每个注意力头的接收范围限制为仅左向位置,实现了在线解码,但仅有部分头部(主导头部)能有效学习对齐关系。
  • HeadDrop正则化通过随机屏蔽部分注意力头,迫使剩余头部更有效地学习,从而减少冗余,改善对齐学习效果。
  • 对低层中的冗余MA头部进行剪枝,可增强注意力头之间的协调性,提升在线ASR中的推理效率。
  • 同步Transformer与基于分块的自注意力机制通过以重叠分块方式处理编码帧,并仅限制注意力于左文上下文,避免了对完整序列的依赖,从而支持流式处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。