Skip to main content
QUICK REVIEW

[论文解读] Influence-Directed Explanations for Deep Convolutional Networks

K. Rustan M. Leino, Shayak Sen|arXiv (Cornell University)|Feb 11, 2018
Explainable Artificial Intelligence (XAI)参考文献 15被引用 6
一句话总结

本文通过测量内部神经元上的分布影响,提出了一种面向深度卷积神经网络的影响导向解释方法,以识别塑造模型行为的高层概念。该方法展示了其解释结果在不同样本间具有泛化能力,能够提取出所学类别的‘本质’特征,并分离出用于区分相似类别的判别性特征,优于基于输入的归因方法。

ABSTRACT

We study the problem of explaining a rich class of behavioral properties of deep neural networks. Distinctively, our influence-directed explanations approach this problem by peering inside the network to identify neurons with high influence on a quantity and distribution of interest, using an axiomatically-justified influence measure, and then providing an interpretation for the concepts these neurons represent. We evaluate our approach by demonstrating a number of its unique capabilities on convolutional neural networks trained on ImageNet. Our evaluation demonstrates that influence-directed explanations (1) identify influential concepts that generalize across instances, (2) can be used to extract the "essence" of what the network learned about a class, and (3) isolate individual features the network uses to make decisions and distinguish related classes.

研究动机与目标

  • 为解决深度卷积神经网络的不透明性问题,提供超越单个输入实例的泛化解释。
  • 识别内部神经元所学习的高层、可泛化的概念,这些概念影响模型在特定分布上的行为。
  • 将内部影响度量与可解释性技术结合,生成能够将神经元行为与模型决策相联系的解释。
  • 克服基于输入的归因方法的局限性,后者由于输入空间的方差而无法在不同实例间泛化。
  • 提供一个理论基础坚实的影响力度量,满足自然公理,并能忠实反映模型在分布上的行为。

提出的方法

  • 提出一种分布影响度量,定义为在特定网络切片上对某一感兴趣量的偏导数,再对感兴趣分布进行平均。
  • 利用该影响度量识别在给定分布(如所有‘猫’图像或特定类别子集)下对模型行为具有高影响的神经元。
  • 应用可视化技术(如激活最大化)来解释最具影响力的神经元所代表的概念。
  • 采用参数化的影响框架,其中切片、感兴趣量和感兴趣分布均可灵活指定,以针对不同的行为特性。
  • 从公理角度证明该影响度量,表明其是唯一满足线性性与一致性等自然性质的家族。
  • 将影响度量与现有解释工具结合,生成既与行为相关又语义清晰的解释。

实验结果

研究问题

  • RQ1在内部神经元上测量的影响能否产生在多个输入实例间泛化的解释,而不同于基于输入的归因方法?
  • RQ2影响导向的解释能否提取出网络表示某一特定类别(如‘跑车’与‘敞篷车’)的‘本质’?
  • RQ3该方法能否分离出网络用于区分语义上相近类别的高层判别性特征?
  • RQ4与基于输入的归因方法(如Integrated Gradients)相比,分布影响在识别有意义概念方面表现如何?
  • RQ5所提出的影响力度量是否在满足理想理论公理的同时,仍能忠实反映模型在分布上的行为?

主要发现

  • 影响导向的解释成功识别出在不同实例间泛化的有影响力概念,而基于输入的影响方法由于像素级贡献的高方差而无法实现泛化。
  • 该方法通过识别代表核心区分特征的神经元(如‘跑车’与‘敞篷车’的车顶形状),提取出类别的‘本质’。
  • 影响导向的解释能分离出网络用于决策的高层特征(如车顶部分),这些特征语义清晰且在不同输入间保持一致。
  • 与基于激活的相关性方法(如Oramas et al.)相比,该影响度量在识别重要神经元方面表现更优,可视化结果更连贯、更具可解释性。
  • 分布影响度量具有理论依据,满足关键公理,是一种可靠且原理严谨的归因方法替代方案。
  • 在ImageNet上的实证结果表明,影响导向的解释比现有基于输入的解释技术提供了更忠实、更具可解释性的模型行为洞察。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。