Skip to main content
QUICK REVIEW

[论文解读] Explaining Neural Networks Semantically and Quantitatively

Runjin Chen, Hao Chen|arXiv (Cornell University)|Dec 18, 2018
Explainable Artificial Intelligence (XAI)参考文献 13被引用 5
一句话总结

本文提出了一种知识蒸馏方法,通过训练一个可解释的加法解释网络,将卷积神经网络(CNN)的预测得分分解为预定义视觉概念的贡献,从而在语义和定量层面解释CNN。该方法通过先验损失减少偏差解释问题,在准确度、语义意义和定量精确度方面优于基线蒸馏方法。

ABSTRACT

This paper presents a method to explain the knowledge encoded in a convolutional neural network (CNN) quantitatively and semantically. The analysis of the specific rationale of each prediction made by the CNN presents a key issue of understanding neural networks, but it is also of significant practical values in certain applications. In this study, we propose to distill knowledge from the CNN into an explainable additive model, so that we can use the explainable model to provide a quantitative explanation for the CNN prediction. We analyze the typical bias-interpreting problem of the explainable model and develop prior losses to guide the learning of the explainable additive model. Experimental results have demonstrated the effectiveness of our method.

研究动机与目标

  • 为解决CNN预测解释在语义清晰度和定量精确度方面的挑战,超越定性或像素级解释。
  • 开发一种方法,解释每个预测背后的推理过程,同时不损害原始CNN的性能或判别能力。
  • 通过结构化的先验损失缓解偏差解释问题——即解释器错误地将预测归因于无关或主导的视觉概念。
  • 通过揭示哪些语义概念对最终预测得分的贡献程度,实现对CNN中问题特征表示的诊断。
  • 通过CelebA等真实世界基准,在不同CNN架构和任务上展示方法的广泛适用性。

提出的方法

  • 训练一个独立的、可解释的解释网络作为加法模型,将预测得分分解为预训练视觉概念检测器的贡献分量。
  • 使用知识蒸馏训练解释网络,使其模仿性能网络的输出得分,而无需使用输入图像的真实标签。
  • 基于视觉概念的统计特性(如频率、相关性)引入先验损失,以指导解释网络并减少归因偏差。
  • 使用性能网络第一层全连接层的特征作为解释网络的共享输入特征,实现一致的表征学习。
  • 应用L-2范数损失,以最小化性能网络与解释网络在训练过程中预测得分的差异。
  • 将解释网络设计为各概念贡献的总和,从而实现对每个概念在最终决策中作用的定量解释。

实验结果

研究问题

  • RQ1我们能否在不依赖标注数据的情况下,为单个CNN预测生成语义上合理且定量精确的解释?
  • RQ2如何减少加法解释模型中的偏差解释问题,即解释器错误地将预测归因于主导或虚假的视觉概念?
  • RQ3在性能网络做出错误预测时,解释模型在在多大程度上能恢复语义概念对CNN预测的真实贡献?
  • RQ4所选视觉概念的数量如何影响解释模型的解释能力与保真度?
  • RQ5该方法是否能广泛应用于不同CNN架构和任务,而不会降低原始模型的性能?

主要发现

  • 与标准蒸馏基线相比,所提方法显著减少了偏差解释问题,表现为视觉概念间贡献分布更加均衡和真实。
  • 在CNN依赖虚假相关性的情况下,所提方法生成的解释与真实人类解释更一致,尤其优于基线方法。
  • 使用更多视觉概念可提升解释能力,表现为性能网络与解释网络得分之间相对偏差明显降低。
  • 即使CNN的决策错误,该方法仍能成功捕捉并量化局部面部属性(如“年轻”、“男性”、“浓妆”)对最终预测的贡献。
  • 解释模型可通过揭示与人类常识相悖的预测往往由少数主导或有偏的视觉概念驱动,从而诊断出问题特征表示。
  • 先验损失的使用使解释更具信息量和代表性,这在分类准确率和相对偏差指标上的性能提升中得到验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。