[论文解读] On the Usefulness of Self-Attention for Automatic Speech Recognition with Transformers
本文研究了在自动语音识别中,上层Transformer编码器中的自注意力机制是否必要。通过用前馈网络替换上层自注意力层并引入一种对角性度量,作者发现上层网络自然地关注局部上下文,因此自注意力在此处冗余——结果是性能未下降,且替换后有轻微提升。
Self-attention models such as Transformers, which can capture temporal relationships without being limited by the distance between events, have given competitive speech recognition results. However, we note the range of the learned context increases from the lower to upper self-attention layers, whilst acoustic events often happen within short time spans in a left-to-right order. This leads to a question: for speech recognition, is a global view of the entire sequence useful for the upper self-attention encoder layers in Transformers? To investigate this, we train models with lower self-attention/upper feed-forward layers encoders on Wall Street Journal and Switchboard. Compared to baseline Transformers, no performance drop but minor gains are observed. We further developed a novel metric of the diagonality of attention matrices and found the learned diagonality indeed increases from the lower to upper encoder self-attention layers. We conclude the global view is unnecessary in training upper encoder layers.
研究动机与目标
- 确定上层Transformer编码器中的全局自注意力机制在自动语音识别中是否必不可少。
- 探究Transformer中全局自注意力成功与RNN模型中单调(局部)注意力带来性能提升之间的差异。
- 分析自注意力层从编码器下层到上层所学习的上下文感受野如何演变。
- 提出一种新型度量方法,用于量化注意力矩阵的对角性,以衡量局部注意力与全局注意力行为。
- 通过在不降低性能的前提下,用前馈层替换上层自注意力层,探索架构效率。
提出的方法
- 在WSJ和Switchboard数据集上训练了上层为前馈网络、下层为自注意力机制的Transformer模型。
- 提出一种新型对角性度量,用于量化注意力头在输入序列中对局部、从左到右时间跨度的关注程度。
- 计算每层编码器中所有注意力头的平均对角性,以追踪注意力模式的演变。
- 比较在替换不同数量的上层自注意力层为前馈层后,模型的性能表现。
- 分析替换前后注意力矩阵对角性的趋势,以评估结构稳定性和注意力行为。
实验结果
研究问题
- RQ1在自动语音识别中,上层Transformer编码器中的自注意力机制是否必须具备全局上下文建模能力?
- RQ2自注意力层在Transformer编码器中从下层到上层的有效感受野如何变化?
- RQ3能否用前馈层替换上层自注意力层,同时保持或提升自动语音识别性能?
- RQ4尽管具有全局访问能力,上层自注意力头在多大程度上学习到对局部、从左到右上下文的关注?
- RQ5注意力矩阵的对角性能否作为识别冗余自注意力层的可靠指标?
主要发现
- 用前馈层替换上层自注意力层后,WSJ和Switchboard数据集上的性能未出现下降,且有轻微提升。
- 注意力矩阵的平均对角性从下层到上层逐渐增加,表明上层注意力模式正向局部、从左到右的关注转变。
- 在12层编码器中,第9层和第10层仍需自注意力机制,因为将其替换为前馈层会增加错误率。
- 最顶层的两层(第11层和第12层)表现出接近最大值的对角性(约1),表明它们仅关注局部上下文,因此自注意力在此处冗余。
- 第7层和第8层也表现出较高的对角性,提示它们可能是可替换的候选层,但替换后错误率上升,可能是因为破坏了上下文流的连贯性。
- 在用前馈网络替换上层后,从下层到上层对角性逐渐增加的整体趋势得以保持,证实了注意力行为的稳定性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。