[论文解读] Using KL-divergence to focus Deep Visual Explanation
本文提出了一种新颖的方法,通过使用Kullback-Leibler(KL)散度聚焦于影响分类的显著图像区域,以解释深度卷积神经网络的预测结果。通过计算预测类别得分与真实标签类别得分之间的KL散度梯度,进行归一化,并将其作为权重图应用于特征图,该方法生成注意力热图,突出显示具有区分性的像素,在VGG-16和AlexNet模型上展示了比基线方法更清晰的定位效果,显著提升了可解释性。
We present a method for explaining the image classification predictions of deep convolution neural networks, by highlighting the pixels in the image which influence the final class prediction. Our method requires the identification of a heuristic method to select parameters hypothesized to be most relevant in this prediction, and here we use Kullback-Leibler divergence to provide this focus. Overall, our approach helps in understanding and interpreting deep network predictions and we hope contributes to a foundation for such understanding of deep learning networks. In this brief paper, our experiments evaluate the performance of two popular networks in this context of interpretability.
研究动机与目标
- 为解决深度卷积神经网络中的可解释性挑战,特别是在医学影像等高风险领域中的应用。
- 开发一种方法,识别并突出显示影响特定分类决策的最关键图像像素。
- 通过使用KL散度作为相关性度量,聚焦于区分性区域,从而提升可视化质量。
- 比较不同网络架构(VGG-16和AlexNet)在生成可解释性解释方面的性能。
提出的方法
- 从预训练的CNN(例如VGG-16)的最后层计算原始类别得分,并利用基于高斯核的相似性度量估计联合概率。
- 通过困惑度(perplexity)对类别得分之间的成对亲和度进行估计,以建模真实标签分布。
- 计算预测分布与真实标签分布之间的KL散度梯度,以识别相关神经元和特征。
- 使用z分数标准化(零均值,单位方差)对KL梯度进行归一化,得到注意力权重α。
- 通过逐元素乘法将归一化的权重α作为空间注意力图应用于特征图,然后对通道维度求和,生成显著性图。
- 对最终的显著性图进行归一化以用于可视化,生成突出显示在分类决策中最具影响力像素的热图。
实验结果
研究问题
- RQ1KL散度如何用于聚焦深度神经网络中视觉解释的最相关图像区域?
- RQ2视觉解释的质量是否与底层深度学习模型的准确性相关?
- RQ3与引导反向传播和Grad-CAM等现有解释技术相比,所提出的基于KL的方法在定位精度方面表现如何?
- RQ4KL散度梯度能否有效捕捉跨多样化图像类别中的区分性特征?
主要发现
- 与基线方法(如引导反向传播和Grad-CAM)相比,所提出的方法在复杂场景中生成了更清晰、更聚焦的显著性图。
- 由于VGG-16的准确性高于AlexNet,其生成的注意力图更具局部化和精确性,表明模型准确性与解释质量之间存在直接相关性。
- KL散度梯度有效识别出如鹦鹉的脸部、球拍的镜片以及交通信号灯的标志等区分性区域,与人类直觉一致。
- 通过z分数变换对KL梯度进行归一化,显著提升了生成注意力图的稳定性和可解释性。
- 该方法成功可视化了COCO数据集中多样化图像的分类决策依据,展示了在不同物体类别上的鲁棒性。
- 该算法具有良好的泛化能力,可扩展至语音和自然语言处理等其他领域,以提升可解释性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。