[论文解读] Influence-Directed Explanations for Deep Convolutional Networks
本文通过测量内部神经元上的分布影响,提出了一种面向深度卷积神经网络的影响导向解释方法,以识别塑造模型行为的高层概念。该方法展示了其解释结果在不同样本间具有泛化能力,能够提取出所学类别的‘本质’特征,并分离出用于区分相似类别的判别性特征,优于基于输入的归因方法。
We study the problem of explaining a rich class of behavioral properties of deep neural networks. Distinctively, our influence-directed explanations approach this problem by peering inside the network to identify neurons with high influence on a quantity and distribution of interest, using an axiomatically-justified influence measure, and then providing an interpretation for the concepts these neurons represent. We evaluate our approach by demonstrating a number of its unique capabilities on convolutional neural networks trained on ImageNet. Our evaluation demonstrates that influence-directed explanations (1) identify influential concepts that generalize across instances, (2) can be used to extract the "essence" of what the network learned about a class, and (3) isolate individual features the network uses to make decisions and distinguish related classes.
研究动机与目标
- 为解决深度卷积神经网络的不透明性问题,提供超越单个输入实例的泛化解释。
- 识别内部神经元所学习的高层、可泛化的概念,这些概念影响模型在特定分布上的行为。
- 将内部影响度量与可解释性技术结合,生成能够将神经元行为与模型决策相联系的解释。
- 克服基于输入的归因方法的局限性,后者由于输入空间的方差而无法在不同实例间泛化。
- 提供一个理论基础坚实的影响力度量,满足自然公理,并能忠实反映模型在分布上的行为。
提出的方法
- 提出一种分布影响度量,定义为在特定网络切片上对某一感兴趣量的偏导数,再对感兴趣分布进行平均。
- 利用该影响度量识别在给定分布(如所有‘猫’图像或特定类别子集)下对模型行为具有高影响的神经元。
- 应用可视化技术(如激活最大化)来解释最具影响力的神经元所代表的概念。
- 采用参数化的影响框架,其中切片、感兴趣量和感兴趣分布均可灵活指定,以针对不同的行为特性。
- 从公理角度证明该影响度量,表明其是唯一满足线性性与一致性等自然性质的家族。
- 将影响度量与现有解释工具结合,生成既与行为相关又语义清晰的解释。
实验结果
研究问题
- RQ1在内部神经元上测量的影响能否产生在多个输入实例间泛化的解释,而不同于基于输入的归因方法?
- RQ2影响导向的解释能否提取出网络表示某一特定类别(如‘跑车’与‘敞篷车’)的‘本质’?
- RQ3该方法能否分离出网络用于区分语义上相近类别的高层判别性特征?
- RQ4与基于输入的归因方法(如Integrated Gradients)相比,分布影响在识别有意义概念方面表现如何?
- RQ5所提出的影响力度量是否在满足理想理论公理的同时,仍能忠实反映模型在分布上的行为?
主要发现
- 影响导向的解释成功识别出在不同实例间泛化的有影响力概念,而基于输入的影响方法由于像素级贡献的高方差而无法实现泛化。
- 该方法通过识别代表核心区分特征的神经元(如‘跑车’与‘敞篷车’的车顶形状),提取出类别的‘本质’。
- 影响导向的解释能分离出网络用于决策的高层特征(如车顶部分),这些特征语义清晰且在不同输入间保持一致。
- 与基于激活的相关性方法(如Oramas et al.)相比,该影响度量在识别重要神经元方面表现更优,可视化结果更连贯、更具可解释性。
- 分布影响度量具有理论依据,满足关键公理,是一种可靠且原理严谨的归因方法替代方案。
- 在ImageNet上的实证结果表明,影响导向的解释比现有基于输入的解释技术提供了更忠实、更具可解释性的模型行为洞察。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。