Skip to main content
QUICK REVIEW

[论文解读] The elephant in the interpretability room: Why use attention as explanation when we have saliency methods?

Jasmijn Bastings, Katja Filippova|arXiv (Cornell University)|Oct 12, 2020
Explainable Artificial Intelligence (XAI)参考文献 24被引用 4
一句话总结

本文立场论文主张,输入显著性方法在解释模型预测方面优于注意力机制,尤其对于寻求忠实、粒度级别相关性分数的模型开发者而言。尽管注意力机制易于提取,但显著性方法更能实现识别最具影响力的输入标记这一目标。作者提倡在自然语言处理的可解释性研究中,从注意力机制转向显著性方法。

ABSTRACT

There is a recent surge of interest in using attention as explanation of model predictions, with mixed evidence on whether attention can be used as such. While attention conveniently gives us one weight per input token and is easily extracted, it is often unclear toward what goal it is used as explanation. We find that often that goal, whether explicitly stated or not, is to find out what input tokens are the most relevant to a prediction, and that the implied user for the explanation is a model developer. For this goal and user, we argue that input saliency methods are better suited, and that there are no compelling reasons to use attention, despite the coincidence that it provides a weight for each input. With this position paper, we hope to shift some of the recent focus on attention to saliency methods, and for authors to clearly state the goal and user for their explanations.

研究动机与目标

  • 挑战在自然语言处理中广泛使用注意力机制作为解释方法的做法,尤其是在已有显著性方法可实现相同目的的情况下。
  • 识别注意力作为解释的隐含目标:识别对预测最具相关性的输入标记。
  • 阐明此类解释的主要使用者通常是模型开发者,而忠实性对这类用户至关重要。
  • 论证显著性方法在实现忠实、粒度级别相关性归因方面优于注意力机制。
  • 鼓励研究人员明确定义解释的目标与使用者,以提升可解释性研究的质量。

提出的方法

  • 分析注意力作为解释的隐含目标:识别对预测最具重要性的输入标记,尤其针对模型开发者。
  • 从模型行为忠实度的角度,对比注意力权重与基于梯度的显著性方法(如积分梯度、Grad-CAM)。
  • 将注意力与既定的显著性基准进行评估,指出显著性方法是专为输入相关性归因而设计的。
  • 回顾实证证据,表明注意力通常与基于梯度的重要性度量相关性较差,且在对抗性扰动下表现不佳。
  • 强调显著性方法仅需一次前向传播与一次反向传播,计算效率与注意力相当。
  • 提出尽管注意力机制在提供粒度级别权重方面较为方便,但不应将其用作显著性的代理。

实验结果

研究问题

  • RQ1为何在已有显著性方法可实现相同目的的情况下,注意力机制仍被普遍用作解释?
  • RQ2在实践中,注意力作为解释的真正目标是什么?其目标用户是谁?
  • RQ3注意力权重在识别相关输入标记方面的忠实度,与既定显著性方法相比如何?
  • RQ4是否存在充分理由偏好注意力机制而非显著性方法用于输入相关性解释?
  • RQ5是否存在其他解释方法能更好地服务于超越粒度级别显著性的不同可解释性目标?

主要发现

  • 注意力作为解释的主要目标是识别对预测最具相关性的输入标记,而显著性方法正是为此目的而设计的。
  • 实证研究表明,注意力权重通常与基于梯度的重要性度量相关性较差,表明其忠实度较低。
  • 注意力机制可被操纵以生成具有欺骗性的权重,错误反映模型对输入标记的依赖程度,即使模型仍能做出正确预测。
  • 如积分梯度和Grad-CAM等显著性方法在识别对预测至关重要的输入特征方面更具可靠性与忠实度。
  • 尽管注意力机制在计算上更便捷,但显著性方法同样高效——仅需一次前向与一次反向传播,且实现复杂度并不更高。
  • 将注意力用作解释时,常隐含因果性解释的定义,但其无法满足该要求,因为注意力仅反映计算过程中某一时刻的关注点,而非因果影响。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。