Skip to main content
QUICK REVIEW

[论文解读] Order in the Court: Explainable AI Methods Prone to Disagreement

Michael Neely, Stefan F. Schouten|arXiv (Cornell University)|May 7, 2021
Explainable Artificial Intelligence (XAI)参考文献 46被引用 7
一句话总结

本文研究了等级相关性作为评估可解释人工智能方法可靠性度量的适用性,对比了在单序列和成对序列任务上,两种神经网络架构下的LIME、Integrated Gradients、DeepLIFT、Grad-SHAP、Deep-SHAP以及基于注意力的解释方法。研究发现不同方法之间存在广泛分歧,结论认为等级相关性不足以评估特征加性解释的质量,主张采用更严格的诊断方法替代。

ABSTRACT

By computing the rank correlation between attention weights and feature-additive explanation methods, previous analyses either invalidate or support the role of attention-based explanations as a faithful and plausible measure of salience. To investigate whether this approach is appropriate, we compare LIME, Integrated Gradients, DeepLIFT, Grad-SHAP, Deep-SHAP, and attention-based explanations, applied to two neural architectures trained on single- and pair-sequence language tasks. In most cases, we find that none of our chosen methods agree. Based on our empirical observations and theoretical objections, we conclude that rank correlation does not measure the quality of feature-additive methods. Practitioners should instead use the numerous and rigorous diagnostic methods proposed by the community.

研究动机与目标

  • 评估等级相关性是否为评估LIME和Integrated Gradients等特征加性解释方法忠实度的有效度量标准。
  • 研究包括基于注意力的解释方法和基于梯度的方法在内的多种可解释AI方法之间的一致性与一致性程度。
  • 挑战先前研究中广泛使用等级相关性来验证注意力机制作为忠实显著性度量的做法。
  • 倡导在评估解释质量时,采用更严格、社区提出的诊断方法替代等级相关性。
  • 提供实证与理论证据,表明等级相关性无法可靠度量特征加性解释的质量。

提出的方法

  • 作者将六种解释方法——LIME、Integrated Gradients、DeepLIFT、Grad-SHAP、Deep-SHAP以及注意力机制——应用于在单序列和成对序列语言任务上训练的两种神经网络架构。
  • 在多个输入样本上,计算注意力权重与特征加性解释方法输出之间的等级相关性。
  • 分析涵盖单序列和成对序列任务,以评估在不同NLP架构和数据类型下的泛化能力。
  • 提出理论论证,表明等级相关性并非解释质量的可靠代理,因其对单调变换敏感且对幅度差异不敏感。
  • 将实证分歧模式与理论预期进行对比,以展示等级相关性作为诊断工具的局限性。
  • 作者建议用更稳健、经社区验证的诊断程序替代等级相关性,以评估解释方法。

实验结果

研究问题

  • RQ1包括注意力机制和基于梯度的方法在内的不同可解释AI方法,在显著性排序上在多大程度上达成一致?
  • RQ2等级相关性是否为评估特征加性解释方法忠实度的有效且可靠的度量标准?
  • RQ3为何先前使用等级相关性验证注意力机制的研究所提供的证据无法得出其忠实度的明确结论?
  • RQ4在深度学习模型中,使用等级相关性评估解释质量存在哪些理论与实证局限性?
  • RQ5从业者应采用哪些替代诊断方法,以取代等级相关性来评估可解释性方法?

主要发现

  • 在大多数实验设置中,所测试的六种解释方法之间未观察到一致的共识,表明不同方法之间存在高度分歧。
  • 由于固有的方法论缺陷,使用等级相关性比较注意力权重与特征加性解释无法可靠度量解释质量。
  • 理论分析表明,等级相关性对幅度差异不敏感,且在单调变换下保持不变,这削弱了其作为诊断工具的有效性。
  • 实证结果表明,即使在相同模型和输入上应用方法,其显著性排序也频繁出现分歧,挑战了方法一致性的假设。
  • 本研究结论认为,从业者应放弃使用等级相关性,转而采用更严格、经社区认可的诊断方法来评估解释质量。
  • 研究结果表明,先前通过等级相关性验证注意力机制的主张在方法论上站不住脚,应予以重新评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。