Skip to main content
QUICK REVIEW

[论文解读] Interpretable Compositional Convolutional Neural Networks

Wen Shen, Zhihua Wei|arXiv (Cornell University)|Jul 9, 2021
Explainable Artificial Intelligence (XAI)参考文献 29被引用 6
一句话总结

本文提出一种方法,将标准卷积神经网络(CNNs)转化为可解释的组合式CNN,使其学习到代表一致且有意义的视觉模式(如物体部件或图像区域)的滤波器,而无需部件或区域的标注。通过引入一种新颖的基于分组的损失函数,该函数在组内强制滤波器一致性、组间保持多样性,模型在可解释性和特征一致性方面优于ICNN等先前方法,同时保持了具有竞争力的分类准确率。

ABSTRACT

The reasonable definition of semantic interpretability presents the core challenge in explainable AI. This paper proposes a method to modify a traditional convolutional neural network (CNN) into an interpretable compositional CNN, in order to learn filters that encode meaningful visual patterns in intermediate convolutional layers. In a compositional CNN, each filter is supposed to consistently represent a specific compositional object part or image region with a clear meaning. The compositional CNN learns from image labels for classification without any annotations of parts or regions for supervision. Our method can be broadly applied to different types of CNNs. Experiments have demonstrated the effectiveness of our method.

研究动机与目标

  • 为了解决可解释人工智能中语义可解释性的核心挑战,定义CNN中更通用且有意义的滤波器可解释性形式。
  • 使卷积神经网络的中间滤波器在不同图像中一致地表示特定的物体部件或图像区域,即使没有部件/区域标注。
  • 确保不同滤波器代表不同的视觉模式,从而增强学习特征的多样性与清晰度。
  • 开发一种训练方法,在显著提升特征可解释性的同时,保持高分类准确率。
  • 超越ICNN中类似球形区域的表示形式,涵盖结构化部件和非结构化图像区域。

提出的方法

  • 引入一种新颖的损失函数,根据滤波器的激活模式对卷积层中的滤波器进行分组,确保同一组内的滤波器一致地表示相同的视觉模式。
  • 使用一种相似性度量方法对滤波器进行分组,该方法通过测量不同输入图像中特征图的一致性,实现对视觉模式的相互验证。
  • 损失函数强制同一组内的滤波器表示相同的物体部件或图像区域,而不同组内的滤波器表示不同的模式,从而促进多样性。
  • 在多分类任务中,引入额外损失函数,确保不同滤波器组由不同类别的部件或区域激活。
  • 该方法端到端应用于多种CNN架构(如VGG、ResNet、DenseNet),无需架构修改或部件/区域标注。
  • 采用两阶段评估框架:定性可视化感受野(RFs)和定量评估滤波器模式的不一致性和多样性。

实验结果

研究问题

  • RQ1能否修改CNN,使其在无任何部件或区域标注的情况下,学习到在不同图像中一致表示相同物体部件或图像区域的滤波器?
  • RQ2所提方法是否在学习到的视觉模式上,相比现有可解释CNN(如ICNN)展现出更高的一致性和多样性?
  • RQ3该方法是否在显著提升特征可解释性的同时,保持具有竞争力的分类准确率?
  • RQ4该方法是否能泛化到不同CNN架构,并同时处理结构化部件和非结构化图像区域?
  • RQ5与随机或非可解释特征相比,学习到的滤波器在语义一致性和视觉清晰度方面表现如何?

主要发现

  • 组合式CNN在视觉模式一致性方面显著优于传统CNN和ICNN,可解释滤波器的不一致性值接近于零。
  • 与ICNN相比,该方法在视觉模式多样性方面表现更优,体现在滤波器组间更高的多样性评分。
  • 在分类任务中,组合式CNN的准确率与传统CNN相当或略高,并在大多数基准测试中优于ICNN(例如,在Helen数据集上ResNet-18的准确率达到99.85%)。
  • 可视化结果表明,组合式CNN中的滤波器一致地表示完整的物体部件或大范围图像区域,而ICNN仅捕捉到小范围的球形区域。
  • t-SNE可视化显示,组合式CNN的特征图聚类更紧密,表明其语义组织性更强。
  • 失败案例极少,仅有少数滤波器未能表示有意义的模式,证实了该方法的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。