Skip to main content
QUICK REVIEW

[论文解读] Embedded Encoder-Decoder in Convolutional Networks Towards Explainable AI

Amirhossein Tavanaei|arXiv (Cornell University)|Jun 19, 2020
Explainable Artificial Intelligence (XAI)被引用 12
一句话总结

本文提出XCNN,一种端到端可解释卷积神经网络,通过在标准CNN中嵌入编码器-解码器结构,无需后处理或定位标注即可生成类别特定的可解释热力图。该模型在CIFAR-10、Tiny ImageNet和MNIST上实现了最先进的视觉可解释性,生成了细节丰富、类别区分度高的激活图,同时保持了极小的准确率下降。

ABSTRACT

Understanding intermediate layers of a deep learning model and discovering the driving features of stimuli have attracted much interest, recently. Explainable artificial intelligence (XAI) provides a new way to open an AI black box and makes a transparent and interpretable decision. This paper proposes a new explainable convolutional neural network (XCNN) which represents important and driving visual features of stimuli in an end-to-end model architecture. This network employs encoder-decoder neural networks in a CNN architecture to represent regions of interest in an image based on its category. The proposed model is trained without localization labels and generates a heat-map as part of the network architecture without extra post-processing steps. The experimental results on the CIFAR-10, Tiny ImageNet, and MNIST datasets showed the success of our algorithm (XCNN) to make CNNs explainable. Based on visual assessment, the proposed model outperforms the current algorithms in class-specific feature representation and interpretable heatmap generation while providing a simple and flexible network architecture. The initial success of this approach warrants further study to enhance weakly supervised localization and semantic segmentation in explainable frameworks.

研究动机与目标

  • 开发一种高性能、可解释的CNN,能够揭示驱动视觉特征,而无需边界框或分割标注。
  • 在单一架构内实现端到端的类别特定显著性图生成,避免后处理步骤。
  • 通过提供精确的基于注意力的特征图,改进弱监督定位和语义分割。
  • 在显著提升模型透明度的同时,通过内在热力图生成保持高分类准确率。
  • 提供一种灵活、模块化的架构,可集成到任何现有CNN分类器中。

提出的方法

  • XCNN架构将标准CNN分类器(如VGG-16)与轻量级编码器-解码器网络作为生成组件相结合。
  • 生成器通过学习从分类器最后一层卷积特征中重建显著特征,生成类别特定的热力图。
  • 编码器-解码器与分类器联合训练,使用标准交叉熵损失,实现端到端优化。
  • 热力图生成完全可微,无需反向传播梯度或训练后的额外推理步骤。
  • 模型未使用外部注意力模块或基于注意力的损失函数;相反,它通过自编码结构学习定位相关特征。
  • 生成器的输出为单通道热力图,突出显示与预测类别相对应的感兴趣区域。

实验结果

研究问题

  • RQ1在CNN中嵌入编码器-解码器是否能生成高质量、类别特定的显著性图,而无需定位标注或后处理?
  • RQ2XCNN架构在视觉可解释性和特征定位准确性方面与现有可解释性方法相比如何?
  • RQ3生成器组件的引入在多大程度上影响了基础CNN的分类准确率?
  • RQ4生成的热力图是否能在极少额外处理的情况下支持弱监督定位和语义分割?
  • RQ5XCNN在MNIST、CIFAR-10和Tiny ImageNet等多样化数据集上,其特征图清晰度和目标定位表现如何?

主要发现

  • 与SOTA方法(如PatternAttribute、deep Taylor分解和Grad-CAM)相比,XCNN生成的热力图在视觉上更优,尤其在存在干扰物的复杂场景中表现更佳。
  • 在CIFAR-10上,XCNN的验证准确率仅比原始VGG-16低2.80%,尽管增加了可解释性组件,性能下降极小。
  • 在Tiny ImageNet上,XCNN的验证准确率比原始VGG-16低2.77%,表明其在更大、更复杂数据集上也具有鲁棒性。
  • 即使存在相似的非目标物体(如手机与啤酒瓶并存),XCNN的热力图仍能更优地突出目标物体像素。
  • 对XCNN生成的热力图进行阈值处理后,成功生成了目标定位任务中的边界框,表明其在弱监督分割中具有潜力。
  • 在生成器后添加1×1卷积层,使CIFAR-10上的验证准确率提升约2%,但降低了热力图质量,证实了准确率与可解释性之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。