Skip to main content
QUICK REVIEW

[论文解读] From Attribution Maps to Human-Understandable Explanations through Concept Relevance Propagation

Reduan Achtibat, Maximilian Dreyer|arXiv (Cornell University)|Jun 7, 2022
Explainable Artificial Intelligence (XAI)参考文献 104被引用 11
一句话总结

本文提出概念相关性传播(CRP),一种通过概念图谱和概念条件解释将显著性图与人类可理解的概念相联系,从而统一深度学习中局部与全局可解释性的方法。CRP通过识别驱动预测的具体概念(例如,眼睛形状、皱纹)及其组合方式,实现对模型决策的精确、可解释性分析,显著提升了标准显著性图的可解释性。

ABSTRACT

The field of eXplainable Artificial Intelligence (XAI) aims to bring transparency to today's powerful but opaque deep learning models. While local XAI methods explain individual predictions in form of attribution maps, thereby identifying where important features occur (but not providing information about what they represent), global explanation techniques visualize what concepts a model has generally learned to encode. Both types of methods thus only provide partial insights and leave the burden of interpreting the model's reasoning to the user. In this work we introduce the Concept Relevance Propagation (CRP) approach, which combines the local and global perspectives and thus allows answering both the "where" and "what" questions for individual predictions. We demonstrate the capability of our method in various settings, showcasing that CRP leads to more human interpretable explanations and provides deep insights into the model's representation and reasoning through concept atlases, concept composition analyses, and quantitative investigations of concept subspaces and their role in fine-grained decision making.

研究动机与目标

  • 解决局部XAI方法的局限性,即仅识别重要特征的‘位置’而未揭示其‘内容’。
  • 弥合全局XAI方法的空白,即揭示模型的一般性概念,但未说明其在单一样本中的使用情况。
  • 通过将模型显著性图与可解释的、语义上有意义的概念相联系,统一局部与全局XAI。
  • 通过概念图谱和概念组合分析,实现对模型决策的精确、人类可理解的解释。
  • 通过提供更清晰、更可靠的模型推理洞察,提升高风险应用场景中的可解释性。

提出的方法

  • CRP通过在特定概念条件下传播相关性,扩展了类似LRP的局部显著性方法,实现网络中的相关性传播。
  • 它采用概念条件相关性计算,以隔离并突出显示与特定学习概念相对应的输入特征部分。
  • 对每层应用相关性归一化,以确保概念重要性独立于模型置信度,从而实现在不同数据分布下的公平比较。
  • 通过RelMax方法从输入中选择参考图像(概念代表),该方法可识别在各层中针对特定概念最大化相关性的输入。
  • 应用归一化(canonization)以重构模型(例如,合并BatchNorm层),以提升显著性分析的稳定性和一致性。
  • 该方法与zennit库集成,支持PyTorch的端到端CRP与RelMax计算,并提供开源支持。

实验结果

研究问题

  • RQ1如何通过识别驱动预测的具体概念,将局部显著性图转化为人类可理解的解释?
  • RQ2在分布外数据下,每层相关性归一化在多大程度上改善了概念表征选择?
  • RQ3概念图谱与概念组合分析能否揭示深度神经网络中的细粒度决策过程?
  • RQ4在多样化的输入样本中,CRP与标准显著性方法在可解释性与一致性方面有何差异?
  • RQ5在复杂的图像分类任务中,概念条件解释能否澄清模糊或重叠的显著性结果?

主要发现

  • 通过每层相关性归一化,即使在模型置信度较低时,也能从分布外数据集(如ImageNet)中选择出概念代表性图像,从而提升概念多样性。
  • 在应用每层归一化后,来自非训练数据集(如Caltech-UCSD Birds 200)的参考样本被更频繁地选中,揭示了与模型置信度无关的概念表征。
  • CRP通过在参考图像上应用概念条件掩码,能够可视化输入图像中的特定概念部分(如虹膜、巩膜或皱纹)。
  • 通过CRP生成的概念图谱揭示了不同概念(如眼睛形状、面部皱纹)如何组合使用以实现细粒度预测(如年龄组分类)。
  • 该方法表明,显著性图可被分解为与特定语义概念相关的有意义、可解释的组件,从而降低模型解释中的模糊性。
  • CRP为概念子空间及其在决策中的作用提供了定量洞察,支持对概念如何贡献于特定预测的分析。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。