Skip to main content
QUICK REVIEW

[论文解读] On Explaining Your Explanations of BERT: An Empirical Study with Sequence Classification

Zhengxuan Wu, Desmond C. Ong|arXiv (Cornell University)|Jan 1, 2021
Topic Modeling参考文献 29被引用 15
一句话总结

本文评估了四种归因方法——梯度敏感性(Gradient Sensitivity, GS)、梯度×输入(Gradient×Input, GI)、逐层相关性传播(Layerwise Relevance Propagation, LRP)以及带注意力的 LRP(LRP with Attention, LAT)——在序列分类任务中解释 BERT 决策的效果。研究发现,GS、GI 和 LRP 在情感分析数据集上能产生可靠、稳健且语义有意义的解释,而 LAT 表现较差;关键的是,所有方法在语义相似的任务之间均展现出显著的相关性,表明其相关性得分具有强泛化能力。

ABSTRACT

BERT, as one of the pretrianed language models, attracts the most attention in recent years for creating new benchmarks across GLUE tasks via fine-tuning. One pressing issue is to open up the blackbox and explain the decision makings of BERT. A number of attribution techniques have been proposed to explain BERT models, but are often limited to sequence to sequence tasks. In this paper, we adapt existing attribution methods on explaining decision makings of BERT in sequence classification tasks. We conduct extensive analyses of four existing attribution methods by applying them to four different datasets in sentiment analysis. We compare the reliability and robustness of each method via various ablation studies. Furthermore, we test whether attribution methods explain generalized semantics across semantically similar tasks. Our work provides solid guidance for using attribution methods to explain decision makings of BERT for downstream classification tasks.

研究动机与目标

  • 评估四种归因方法(GS、GI、LRP 和 LAT)在解释 BERT 用于序列分类决策时的可靠性与稳健性。
  • 探究归因方法是否能在语义相似的下游任务(如情感分析)中产生可泛化的解释。
  • 评估归因分数对微调 BERT 模型时随机权重初始化的敏感性。
  • 为在分类任务中探究 BERT 决策机制时选择合适的归因方法提供实证指导。

提出的方法

  • 将四种归因方法——梯度敏感性(Gradient Sensitivity, GS)、梯度×输入(Gradient×Input, GI)、逐层相关性传播(Layerwise Relevance Propagation, LRP)以及带注意力的 LRP(LRP with Attention, LAT)——适配至带有分类头的 BERT 模型。
  • 在四个情感分类数据集(SST-5、SemEval、IMDb 和 Yelp)上应用这些方法,计算输入序列的词元级相关性得分。
  • 通过按相关性降序逐个移除词元进行消融研究,测量模型准确率下降情况,以评估方法的可靠性。
  • 计算不同随机权重初始化下相关性得分的皮尔逊相关系数,以评估稳健性。
  • 通过测量共享词汇词在不同数据集间相关性得分的相关性,检验方法在任务间的语义泛化能力。
  • 梯度类方法使用 L2 范数,LRP 使用绝对值之和计算相关性得分,实现代码已公开发布。

实验结果

研究问题

  • RQ1在多个情感分析数据集中,GS、GI、LRP 和 LAT 在识别 BERT 分类决策中重要词元方面是否可靠?
  • RQ2在 BERT 微调过程中,归因分数对随机权重初始化的敏感性如何?
  • RQ3归因方法在语义相似的任务(如影评和推文)之间泛化程度如何?
  • RQ4在具有共享语义的多个数据集中,不同归因方法的相关性得分是否表现出有意义的相关性?

主要发现

  • GS、GI 和 LRP 在高相关性词元被消融时表现出一致且可靠的性能下降,表明其与模型决策高度对齐。
  • LAT 在消融研究中表现较差,性能下降模式接近随机移除词元,表明其未能识别出有意义的特征。
  • 所有四种归因方法在不同数据集间共享词汇的相关性得分均表现出强皮尔逊相关性(r > 0.7),表明其在语义相似任务间具有良好的泛化能力。
  • 随机权重初始化会影响相关性得分,但影响有限——尤其在较短序列中,一致性更高。
  • LRP 产生的相关性得分最为多样化且语义丰富,能更有效地突出具有强烈情感语义的词语,优于 GS 和 GI。
  • 结果表明,BERT 的内部表征不仅具有任务特异性,还可在相似语义领域间泛化,这在一致的归因模式中得到体现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。