[论文解读] Rethinking Attention-Model Explainability through Faithfulness Violation Test
本文提出了一种忠实性违背检测方法,用于通过评估极性一致性来评估基于注意力的解释方法——即解释权重是否正确反映输入特征是促进还是抑制模型预测。该方法揭示,大多数注意力解释方法,尤其是原始注意力机制,存在较高的忠实性违背现象,而基于梯度的方法(如 Attention ⊙ Gradient)则表现出显著更低的违背率,凸显在可解释性评估中应优先考虑极性一致性。
Attention mechanisms are dominating the explainability of deep models. They produce probability distributions over the input, which are widely deemed as feature-importance indicators. However, in this paper, we find one critical limitation in attention explanations: weakness in identifying the polarity of feature impact. This would be somehow misleading -- features with higher attention weights may not faithfully contribute to model predictions; instead, they can impose suppression effects. With this finding, we reflect on the explainability of current attention-based techniques, such as Attentio$\odot$Gradient and LRP-based attention explanations. We first propose an actionable diagnostic methodology (henceforth faithfulness violation test) to measure the consistency between explanation weights and the impact polarity. Through the extensive experiments, we then show that most tested explanation methods are unexpectedly hindered by the faithfulness violation issue, especially the raw attention. Empirical analyses on the factors affecting violation issues further provide useful observations for adopting explanation methods in attention models.
研究动机与目标
- 为现有忠实性评估中忽略基于注意力解释的极性一致性这一关键空白提供解决方案。
- 诊断解释权重是否准确反映输入特征是促进还是抑制模型预测。
- 在新标准下评估广泛使用的解释方法(如 Attention Rollout、LRP 基方法)的表现。
- 识别导致注意力解释中忠实性违背的架构与方法因素。
- 倡导将极性一致性作为设计与评估可信解释方法的必要标准。
提出的方法
- 提出一种诊断性忠实性违背检测方法,用于评估最高注意力权重的符号是否正确指示对应输入特征的实际影响极性(促进或抑制)。
- 对每个样本,识别最大绝对值注意力权重,并检查其符号是否与通过移除前10%加权输入成分后通过置信度扰动确定的真实影响方向一致。
- 使用置信度扰动(ΔC)来衡量移除高注意力区域的影响:ΔC < 0 表示抑制,ΔC > 0 表示促进。
- 在六个多样化任务和九个数据集上,对九种解释方法(包括原始注意力、Attention ⊙ Gradient 和基于 LRP 的变体)应用该测试。
- 采用替换函数以缓解扰动中的分布外(OOD)问题,确保忠实性评估的稳健性。
- 将该违背测试与现有忠实性度量进行比较,表明先前的度量无法检测到极性不一致。
实验结果
研究问题
- RQ1现有基于注意力的解释方法在在多大程度上未能保留特征影响的极性,即高注意力权重是否正确指示特征是促进还是抑制模型预测?
- RQ2所提出的忠实性违背检测方法与现有忠实性评估度量相比,在检测极性不一致方面表现如何?
- RQ3哪些解释方法表现出最低的忠实性违背率,其架构或方法因素如何促进性能提升?
- RQ4模型复杂度和识别影响极性的能力如何影响忠实性违背的发生概率?
- RQ5与原始注意力或基于 LRP 的方法相比,基于梯度的注意力解释方法(如 Attention ⊙ Gradient)是否能降低忠实性违背?
主要发现
- 在 VQA v2.0 数据集上,原始注意力机制的忠实性违背比率高达 40%,表明在 40% 的情况下,高注意力区域实际上抑制了模型置信度而非支持其预测。
- Attention ⊙ Gradient 方法在 Yelp 上将违背率降低至 2%,在 AgNews 上为 3%,在 VQA v2.0 上为 6%,显著提升了极性一致性。
- 基于绝对梯度值的方法(如 Attention ⊙ |∇α|)和基于符号的梯度方法(如 Attention ⊙ sign(∇α))表现出中等改进,其在 Yelp、AgNews 和 VQA 上的违背率分别为 15%、7% 和 25%。
- 研究发现,模型架构复杂度和其内在识别影响极性的能力是影响忠实性违背频率的关键因素。
- 现有忠实性评估度量无法检测到极性不一致,凸显了所提出违背检测方法在全面评估中的必要性。
- 实证结果表明,即使重要性相关性很高,若解释方法未能保持极性一致性,仍可能具有误导性,如在 VQA 数据集的红点违背案例中所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。