[论文解读] Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors
本文提出一种字典学习方法,将Transformer中的上下文嵌入可视化为学习到的“Transformer因子”的稀疏线性叠加,揭示了多义性消歧、句子级模式形成以及长距离依赖等层次化语义结构。该方法实现了可解释的、数据驱动的可视化,揭示了预期的语言学模式以及超越先前知识的新型、出人意料的表征。
Transformer networks have revolutionized NLP representation learning since they were introduced. Though a great effort has been made to explain the representation in transformers, it is widely recognized that our understanding is not sufficient. One important reason is that there lack enough visualization tools for detailed analysis. In this paper, we propose to use dictionary learning to open up these "black boxes" as linear superpositions of transformer factors. Through visualization, we demonstrate the hierarchical semantic structures captured by the transformer factors, e.g., word-level polysemy disambiguation, sentence-level pattern formation, and long-range dependency. While some of these patterns confirm the conventional prior linguistic knowledge, the rest are relatively unexpected, which may provide new insights. We hope this visualization tool can bring further knowledge and a better understanding of how transformer networks work. The code is available at https://github.com/zeyuyun1/TransformerVis
研究动机与目标
- 为解决当前缺乏有效工具来解释Transformer模型中上下文表示的问题。
- 克服探针任务的局限性,后者通常过于简单,无法揭示超出先前语言学知识的表征。
- 实现在模型分层架构中对语言结构的细粒度定位。
- 开发一种方法,揭示已知语言现象以及注意力机制表征中的新颖、出人意料的模式。
- 提供一种数据驱动的、可解释的框架,用于分析Transformer如何编码上下文敏感的语义。
提出的方法
- 该方法通过非负稀疏编码,将上下文词嵌入建模为学习到的“Transformer因子”的稀疏线性组合。
- 在多个Transformer层上联合训练一个字典,以捕捉来自所有深度的层次化表征。
- 优化过程使用FISTA求解逆问题:$ x = \Phi\alpha + \epsilon $,其中 $ \alpha \succeq 0 $,确保非负且稀疏的系数。
- 字典 $ \Phi \in \mathbb{R}^{d \times m} $ 为超完备($ m > d $),以实现丰富且解耦的语义内容分解。
- 该方法利用跳跃连接,将每一层的输出建模为来自所有下层修改的叠加。
- 该方法应用于从BERT类模型中收集的所有层的上下文嵌入,实现对学习到的因子的可视化。
实验结果
研究问题
- RQ1Transformer中的上下文词嵌入能否有意义地分解为可解释语义因子的稀疏线性叠加?
- RQ2从学习到的因子中,会涌现出哪些层次化语义结构,如多义性、句法模式或长距离依赖?
- RQ3学习到的因子是否揭示了已知的语言学现象,还是发现了新颖、出人意料的表征?
- RQ4这种分解在不同层之间如何变化,这对Transformer中语义信息流动意味着什么?
- RQ5该方法能否精确定位特定语言特征在模型架构中的编码位置?
主要发现
- 该方法成功可视化了层次化语义结构,包括词级多义性消歧,即同一词语在不同上下文中由不同因子表示。
- 观察到句子级模式形成,因子捕捉了跨文本跨度的句法和话语级依赖关系。
- 长距离依赖通过因子的分布式、稀疏组合进行编码,表明存在一种用于长距离推理的组合机制。
- 部分学习到的因子与传统语言学类别(如词性、命名实体)对齐,验证了该方法的可解释性。
- 其他因子代表了非传统、出人意料的语义模式,表明对Transformer处理语言的新结构洞见。
- 因子分解在各层间保持稳定,表明表征通过加法式修改逐步演化,与跳跃连接假设一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。