Skip to main content
QUICK REVIEW

[论文解读] Do Transformer Attention Heads Provide Transparency in Abstractive Summarization?

Joris Baan, Maartje ter Hoeve|arXiv (Cornell University)|Jul 1, 2019
Topic Modeling参考文献 23被引用 9
一句话总结

本文通过分析注意力模式,研究了用于生成式摘要的Transformer模型中自注意力头与交叉注意力头是否能提供真正的可解释性。结合定性可视化与新型定量指标(POS-KL、NEP及相对位置专业化),结果表明:部分注意力头确实会针对命名实体、词性、标点等语言学上有意义的元素进行专业化,但这种专业化在不同模型与文档间表现不一致,因而对仅依赖注意力机制进行模型可解释性的做法提出质疑。

ABSTRACT

Learning algorithms become more powerful, often at the cost of increased complexity. In response, the demand for algorithms to be transparent is growing. In NLP tasks, attention distributions learned by attention-based deep learning models are used to gain insights in the models' behavior. To which extent is this perspective valid for all NLP tasks? We investigate whether distributions calculated by different attention heads in a transformer architecture can be used to improve transparency in the task of abstractive summarization. To this end, we present both a qualitative and quantitative analysis to investigate the behavior of the attention heads. We show that some attention heads indeed specialize towards syntactically and semantically distinct input. We propose an approach to evaluate to which extent the Transformer model relies on specifically learned attention distributions. We also discuss what this implies for using attention distributions as a means of transparency.

研究动机与目标

  • 评估用于生成式摘要的Transformer模型中注意力头是否能真正揭示模型行为的透明性。
  • 探究注意力头是否针对命名实体、词性、相对位置等语言学可解释的输入元素实现专业化。
  • 开发定量指标,以衡量在1,000篇新闻文章中大规模注意力头的专业化程度,超越仅挑选案例的可视化分析。
  • 通过对抗性注意力方法评估模型对特定注意力分布的依赖性,质疑注意力是否能作为因果解释。
  • 考察注意力专业化在不同模型权重初始化与文档类型之间的一致性。

提出的方法

  • 对多个示例中的编码器自注意力头与解码器交叉注意力头进行定性视觉检查,以识别注意力分布中的模式。
  • 提出三种定量指标:POS-KL(词性Kullback-Leibler散度)、NEP(命名实体比例)以及基于相对位置的注意力专业化,用于衡量在1,000篇新闻文章中注意力头的行为。
  • 在相同生成式摘要数据集上,使用不同随机初始化训练多个Transformer模型,以评估注意力头专业化的一致性。
  • 将对抗性注意力方法(Jain和Wallace,2019)适配至序列到序列Transformer模型,通过约束top-K束搜索概率来评估修改单个注意力头的因果影响。
  • 构建对抗性注意力分布,将特定注意力头的注意力从位置重定向至人物等类别,以测试此类修改是否影响摘要生成。
  • 使用与束搜索兼容的对抗性扰动,在保持输出序列完全一致的同时修改注意力分布,从而实现对注意力头影响的受控评估。

实验结果

研究问题

  • RQ1在用于生成式摘要的Transformer模型中,单个注意力头在多大程度上会针对命名实体、词性或标点等语言学上有意义的输入元素实现专业化?
  • RQ2在相同数据上训练的不同模型权重初始化下,注意力头的专业化程度是否一致?
  • RQ3POS-KL与NEP等定量指标能否可靠地衡量并推广注意力头的专业化程度,而不仅依赖于视觉检查?
  • RQ4模型在多大程度上依赖于特定的注意力分布?对抗性地操纵注意力头是否会影响摘要输出?
  • RQ5在相同架构下,若存在多个不一致的专业化现象,是否削弱了将注意力分布作为模型行为透明解释的可信度?

主要发现

  • Transformer模型中的部分注意力头会针对命名实体、词性、标点及特定词类(如人物、地点)等可解释的输入元素实现专业化。
  • 所提出的定量指标(POS-KL、NEP及基于相对位置的专业化)成功识别并推广了1,000篇新闻文章中专业化头的行为,验证了视觉观察结果。
  • 注意力头的专业化在不同模型初始化之间并不一致,表明注意力模式并非仅由数据或架构唯一决定。
  • 即使在头部看似实现专业化(如关注命名实体)的情况下,它们有时仍会关注无关标记,表明其对预期语义角色的忠实度有限。
  • 对抗性注意力方法表明,修改注意力分布可能影响模型输出,但由于模型复杂性与冗余性,该影响的范围尚不明确。
  • 本研究结论认为,尽管注意力头可提供部分可解释性,但不应作为模型行为的最终解释,因其存在不一致性和潜在的因果影响不足问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。