Skip to main content
QUICK REVIEW

[论文解读] An Interpretability Illusion for BERT

Tolga Bolukbasi, Adam Pearce|arXiv (Cornell University)|Apr 14, 2021
Topic Modeling参考文献 26被引用 10
一句话总结

本文揭示了 BERT 中存在的「可解释性幻觉」,即某些神经元看似编码了简单、可解释的概念(例如歌曲标题),这是基于单一数据集的激活最高句子得出的结论,但当在其他数据集上测试时,这些解释会崩溃——表明看似存在的模式实则是数据集特异性分布偏差的产物,而非真正的语义表征。其核心贡献在于提出一种方法论警示:可解释性声明必须在多个数据集上进行验证,以避免得出误导性结论。

ABSTRACT

We describe an "interpretability illusion" that arises when analyzing the BERT model. Activations of individual neurons in the network may spuriously appear to encode a single, simple concept, when in fact they are encoding something far more complex. The same effect holds for linear combinations of activations. We trace the source of this illusion to geometric properties of BERT's embedding space as well as the fact that common text corpora represent only narrow slices of possible English sentences. We provide a taxonomy of model-learned concepts and discuss methodological implications for interpretability research, especially the importance of testing hypotheses on multiple data sets.

研究动机与目标

  • 探究 BERT 最后一层中的单个神经元是否编码了可解释、人类可理解的概念。
  • 研究为何某些神经元在某一数据集中似乎能检测到特定语言模式(例如歌曲标题),但在其他数据集中却不能。
  • 识别这种不一致的根本原因,尤其是数据集的分布偏差和嵌入空间的几何特性。
  • 质疑仅依赖单一数据集的最高激活句子来做出可解释性声明的有效性。
  • 倡导将多数据集验证作为可解释性研究中的必要标准。

提出的方法

  • 通过在三个不同数据集(Quora 问题对(QQP)、基于维基百科的问答数据集、多伦多 BookCorpus)中识别 BERT 最后一层神经元的最高激活句子,对单个神经元进行探测。
  • 使用余弦相似度和欧氏距离衡量最高激活句子与随机句子之间的语义一致性,评估这些模式是局部的还是全局的。
  • 对最高激活句子进行人工标注,以评估感知到的模式在标注者之间是否一致。
  • 追踪哪些神经元最常被异常句子(距离中心点最远的 1% 和 10%)激活,以评估极端激活是否导致了该幻觉。
  • 将概念方向分类为三类:局部(附近句子)、全局(在所有数据中一致)和数据集级(仅针对某一数据分布)。
  • 分析标注者之间的分歧与偏差,以评估感知到的模式是否具有主观性而非客观性。

实验结果

研究问题

  • RQ1当通过最高激活句子分析时,BERT 最后一层的神经元是否编码了可解释、一致的语义概念?
  • RQ2为何在最高激活句子中看似连贯的模式在不同数据集上测试时会消失?
  • RQ3在自然语言语料库中,感知到的神经元可解释性在多大程度上是数据集特异性分布偏差的产物?
  • RQ4BERT 激活空间的几何特性在多大程度上导致了可解释性幻觉?
  • RQ5人类标注者能否可靠地识别出最高激活句子中的有意义模式,还是解释容易受到主观偏见的影响?

主要发现

  • 在 Quora 问题对数据集中,看似编码了‘歌曲标题’的神经元,在基于维基百科的问答数据集上测试时,实际编码的是‘历史事件’或‘以日期开头的句子’。
  • 同一神经元(例如神经元 221)在不同数据集中激活了完全不同的语义模式——例如在 QQP 中为歌曲标题,在维基百科中为历史事件,在 BookCorpus 中为叙事动作——表明其解释具有数据集依赖性。
  • 最高激活句子在不同数据集之间语义不一致:距离中心点最远的 1% 句子贡献了全部最高激活的 48%,表明极端异常值驱动了表观模式。
  • 标注者在是否检测到模式的问题上存在显著分歧,一位标注者平均仅识别出 1.6 个模式,表明模式检测具有高度主观性。
  • 即使排除距离最远的 1% 或 10% 的句子,该幻觉依然存在,表明其并非由异常值引起,而是由底层的数据集偏差所致。
  • 尽管存在幻觉,BERT 激活空间中仍存在有意义的全局概念方向,但这些方向被数据集特异性的局部模式所掩盖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。