Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Learning of Neural Networks to Explain Neural Networks

Quanshi Zhang, Yang Yu|arXiv (Cornell University)|May 18, 2018
Explainable Artificial Intelligence (XAI)参考文献 43被引用 17
一句话总结

该论文提出了一种无监督解释网络,能够从预训练的CNN中解耦出可解释的物体部件表征,而无需使用任何标注数据。通过知识蒸馏,该解释网络学习重建高层特征,同时强制每个卷积核仅表示单一物体部件,显著提升了可解释性——在基于VGG的解释器中,超过80%的特征激活来自可解释的部件,且信息损失极小。

ABSTRACT

This paper presents an unsupervised method to learn a neural network, namely an explainer, to interpret a pre-trained convolutional neural network (CNN), i.e., explaining knowledge representations hidden in middle conv-layers of the CNN. Given feature maps of a certain conv-layer of the CNN, the explainer performs like an auto-encoder, which first disentangles the feature maps into object-part features and then inverts object-part features back to features of higher conv-layers of the CNN. More specifically, the explainer contains interpretable conv-layers, where each filter disentangles the representation of a specific object part from chaotic input feature maps. As a paraphrase of CNN features, the disentangled representations of object parts help people understand the logic inside the CNN. We also learn the explainer to use object-part features to reconstruct features of higher CNN layers, in order to minimize loss of information during the feature disentanglement. More crucially, we learn the explainer via network distillation without using any annotations of sample labels, object parts, or textures for supervision. We have applied our method to different types of CNNs for evaluation, and explainers have significantly boosted the interpretability of CNN features.

研究动机与目标

  • 解决深度CNN中可解释性不足的问题,特别是中间层特征图通常混乱且不直观的问题。
  • 开发一种方法,自动识别并从预训练CNN中提取人类可解释的物体部件特征,而无需依赖标注数据。
  • 在保持原始CNN分类性能的同时,通过辅助解释网络增强特征可解释性。
  • 使用户能够理解模型在特定预测中编码并激活了哪些物体部件,从而提升对模型决策的信任。
  • 通过蒸馏训练解释网络以重建高层特征,最小化特征解耦过程中的信息损失。

提出的方法

  • 将解释网络作为轻量级自编码器附加到预训练CNN(即“表演者”)上,且不对表演者的网络架构进行任何修改。
  • 在解释网络的编码器中使用可解释的卷积核,通过一种新颖的核损失函数,强制每个核仅表示单一物体部件。
  • 应用核损失,鼓励每个核仅在物体的单一、一致区域激活(例如,左眼,而非多个重复的边缘),从而抑制类似纹理的模式。
  • 通过知识蒸馏训练解释网络:最小化解释网络解码后的特征与表演者高层特征图之间的重建损失。
  • 使用感受野可视化和Grad-CAM验证,可解释核关注于特定且语义上有意义的物体部件。
  • 引入一种定量指标——p值,用于衡量解释网络中可解释特征对分类分数的贡献比例。

实验结果

研究问题

  • RQ1我们能否在无任何监督的情况下,自动从预训练CNN的混乱中间层特征图中发现并解耦出人类可解释的物体部件表征?
  • RQ2无监督解释网络在保留语义可解释性的同时,能在多大程度上重建CNN的原始特征图?
  • RQ3核损失函数如何促进学习部件特异性特征,而非类似纹理或重复模式的特征?
  • RQ4可解释特征对最终分类决策的定量贡献是多少?与原始CNN相比有何差异?
  • RQ5该解释网络能否用于诊断特定预测中激活了哪些具体物体部件,从而提升模型透明度?

主要发现

  • 对于基于VGG的解释器,特征图中超过80%的激活得分来自可解释的核,表明物体部件被有效解耦。
  • 解释网络实现了高保真度的重建:在重建特征上的分类准确率与原始表演者相比仅下降1–4%,误差差值(Δ Error)仅为1–4%。
  • 核损失成功促使每个核仅表示单一物体部件,如Grad-CAM注意力图所示,其聚焦于头部、颈部和躯干等明确且语义上有意义的区域。
  • 解释网络分别学习了58、167和243个核来表示鸟类的头部、颈部和躯干,展示了其学习结构化、基于部件表征的能力。
  • 使用分类损失而非重建损失训练的“解释器+分类”基线模型,在分类性能上甚至超过了原始表演者,表明当使用不同目标函数训练时,解释网络可超越原始模型性能。
  • 感受野可视化结果表明,可解释核具有局部化且一致的感受野,与物体部件对齐;而普通核则表现出弥散且对纹理敏感的响应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。