Skip to main content
QUICK REVIEW

[论文解读] Weak-Attention Suppression For Transformer Based Speech Recognition

Yangyang Shi, Yongqiang Wang|arXiv (Cornell University)|May 18, 2020
Speech Recognition and Synthesis参考文献 26被引用 5
一句话总结

本文提出弱注意力抑制(WAS),一种动态稀疏化机制,通过将低于学习阈值的注意力权重设为零并重新归一化,来抑制基于Transformer的自动语音识别(ASR)中的低注意力概率。WAS在流式模型上将LibriSpeech test-clean的WER降低了10%,test-other降低了5.2%,通过过滤冗余且非关键的声学帧(尤其是静音和相邻冗余帧)提升了性能。

ABSTRACT

Transformers, originally proposed for natural language processing (NLP) tasks, have recently achieved great success in automatic speech recognition (ASR). However, adjacent acoustic units (i.e., frames) are highly correlated, and long-distance dependencies between them are weak, unlike text units. It suggests that ASR will likely benefit from sparse and localized attention. In this paper, we propose Weak-Attention Suppression (WAS), a method that dynamically induces sparsity in attention probabilities. We demonstrate that WAS leads to consistent Word Error Rate (WER) improvement over strong transformer baselines. On the widely used LibriSpeech benchmark, our proposed method reduced WER by 10%$ on test-clean and 5% on test-other for streamable transformers, resulting in a new state-of-the-art among streaming models. Further analysis shows that WAS learns to suppress attention of non-critical and redundant continuous acoustic frames, and is more likely to suppress past frames rather than future ones. It indicates the importance of lookahead in attention-based ASR models.

研究动机与目标

  • 解决基于Transformer的ASR中冗余且非关键声学帧的问题,其中相邻帧高度相关且长距离依赖性较弱。
  • 通过在不改变softmax函数的前提下诱导注意力机制中的动态稀疏性,提升模型效率和准确性。
  • 通过抑制对静音或冗余帧的注意力,提升流式与非流式基于Transformer的ASR模型的性能。
  • 通过分析时间位置上的抑制模式,探究前瞻(lookahead)在注意力机制ASR中的作用。
  • 在LibriSpeech基准上,通过所提方法建立流式基于Transformer的ASR的新SOTA(最先进)性能。

提出的方法

  • 基于每个输入帧的注意力概率分布,动态估计一个阈值,以识别弱注意力头。
  • 将所有低于估计阈值的注意力概率设为零,并对剩余概率重新归一化,使其总和为1。
  • 在所有头和输入序列中,将该抑制机制应用于每个多头自注意力层。
  • 采用可微分的阈值估计策略,实现每帧和每层的自适应调整,同时在训练过程中保持梯度流动。
  • 将WAS集成到非流式和可流式处理的基于Transformer的ASR模型中,包括采用分块处理和记忆库的模型。
  • 在保留标准softmax注意力机制的同时,通过抑制引入稀疏性,与那些用稀疏激活函数替代softmax的方法不同。
(a) wav
(a) wav

实验结果

研究问题

  • RQ1动态抑制低注意力概率是否能提升基于Transformer的ASR在语音识别任务上的性能?
  • RQ2对静音或冗余声学帧抑制注意力是否能带来更好的泛化能力并降低WER?
  • RQ3在深层架构中,较低层与上层的抑制模式有何系统性差异?
  • RQ4过去和未来上下文帧之间的抑制是否存在系统性差异?这说明前瞻的重要性如何?
  • RQ5WAS是否能在不同模型尺寸下,持续提升流式与非流式基于Transformer的ASR模型?

主要发现

  • WAS在流式Transformer模型上使LibriSpeech test-clean的WER相对降低10.0%,test-other降低5.2%,在流式模型中创下新的SOTA性能。
  • 该方法成功抑制了对静音和冗余声学帧的注意力,尤其在低层中最为显著,对相邻帧的抑制尤为明显。
  • 第一层Transformer中的注意力抑制程度显著高于第12层(约高出10倍),表明低层更关注细粒度的声学细节。
  • 对过去上下文(左侧)的注意力抑制多于未来上下文(右侧),尤其在深层网络中,凸显了前瞻在注意力机制ASR中的重要性。
  • 该抑制机制有效减少了对非关键帧的注意力,同时保留了有意义的长距离依赖关系,提升了模型鲁棒性。
  • 该改进在不同模型尺寸(12层和24层)及模型变体(流式与非流式)中均保持一致,证明了其广泛适用性。
(b) layer 1
(b) layer 1

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。