[论文解读] Attention is Not Only a Weight: Analyzing Transformers with Vector Norms
本文提出基于范数的分析方法,通过引入经过变换的输入向量的L2范数,对传统的基于权重的注意力分析进行补充,揭示了注意力输出不仅依赖于注意力权重,还依赖于向量的大小。该方法发现,BERT对特殊标记的注意力权重被低估,且通过范数调制控制频繁词的贡献;同时,与仅依赖权重的方法相比,该方法在神经机器翻译系统中能实现更精确的词对齐。
Attention is a key component of Transformers, which have recently achieved considerable success in natural language processing. Hence, attention is being extensively studied to investigate various linguistic capabilities of Transformers, focusing on analyzing the parallels between attention weights and specific linguistic phenomena. This paper shows that attention weights alone are only one of the two factors that determine the output of attention and proposes a norm-based analysis that incorporates the second factor, the norm of the transformed input vectors. The findings of our norm-based analyses of BERT and a Transformer-based neural machine translation system include the following: (i) contrary to previous studies, BERT pays poor attention to special tokens, and (ii) reasonable word alignment can be extracted from attention mechanisms of Transformer. These findings provide insights into the inner workings of Transformers.
研究动机与目标
- 为解决基于权重的注意力分析忽略变换后输入向量大小的局限性。
- 提出一种基于范数的分析方法,综合考虑注意力机制输出中的注意力权重与向量范数。
- 深入揭示Transformer如何处理特殊标记等语言元素,如[SEP]和频繁词。
- 证明在基于Transformer的神经机器翻译系统中,通过考虑向量范数,可从源-目标注意力中提取出比仅依赖权重方法更精确的词对齐。
提出的方法
- 提出一种基于范数的分析框架,评估注意力机制中投影矩阵变换后值向量的L2范数。
- 通过应用值变换 $\boldsymbol{v}(\boldsymbol{x}_j) = \boldsymbol{x}_j \boldsymbol{W}^V + \boldsymbol{b}^V$ 测量每个输入向量的范数,以评估其贡献大小。
- 将向量范数与注意力权重结合,计算综合贡献度量,揭示高权重并不总意味着高有效贡献。
- 将该方法应用于BERT和基于Transformer的NMT系统,分析标记级别的注意力动态与词对齐质量。
- 将基于范数的结果与标准的基于权重的分析进行比较,识别出对注意力行为感知的差异。
- 使用公开可用的代码在多个模型和任务上复现并验证研究结果。
实验结果
研究问题
- RQ1变换后输入向量的范数在多大程度上影响Transformer中注意力机制的最终输出?
- RQ2为何以往基于权重的分析无法准确反映BERT中[SEP]等特殊标记的真实贡献?
- RQ3基于范数的分析能否提升基于Transformer的神经机器翻译系统中词对齐的质量?
- RQ4频繁但信息量低的词在多大程度上影响注意力输出,其影响又如何被控制?
- RQ5通过同时考虑注意力权重与变换后向量的大小,能否更准确地解释注意力机制?
主要发现
- 由于向量范数较低,BERT的注意力机制对[SEP]等特殊标记的有效注意力远低于仅从注意力权重中推断出的结果。
- 频繁但信息量低的词对注意力输出的贡献,是通过范数调制被主动抑制的,而不仅仅是通过注意力权重的降低。
- 基于范数的分析表明,仅依赖注意力权重不足以解释注意力动态,因为高权重可能被较小的向量范数所抵消。
- 在基于Transformer的NMT系统中,使用基于范数的注意力提取的词对齐比仅依赖注意力权重的方法更准确。
- 所提出的基于范数的方法比基于权重的分析提供了更细致、更准确的注意力行为解释,尤其在识别真正信息贡献者方面表现更优。
- 该方法在不同输入长度下均表现稳健,且避免了以往仅考虑注意力权重二值化抵消的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。