Skip to main content
QUICK REVIEW

[论文解读] What You See is What You Classify: Black Box Attributions

Steven Stalder, Nathanaël Perraudin|arXiv (Cornell University)|May 23, 2022
Explainable Artificial Intelligence (XAI)被引用 6
一句话总结

本文提出了一种新颖的方法,通过训练一个独立的“解释器”网络,从一个预训练且冻结的“被解释模型”分类器中预测显著性掩码,从而为深度图像分类器生成清晰、类别特定的归因掩码。与基于梯度或扰动的方法不同,该解释器网络在单次前向传播中即可生成精确、边界准确的掩码,在PASCAL VOC-2007和COCO-2014基准测试中表现出优越的视觉与定量性能。

ABSTRACT

An important step towards explaining deep image classifiers lies in the identification of image regions that contribute to individual class scores in the model's output. However, doing this accurately is a difficult task due to the black-box nature of such networks. Most existing approaches find such attributions either using activations and gradients or by repeatedly perturbing the input. We instead address this challenge by training a second deep network, the Explainer, to predict attributions for a pre-trained black-box classifier, the Explanandum. These attributions are provided in the form of masks that only show the classifier-relevant parts of an image, masking out the rest. Our approach produces sharper and more boundary-precise masks when compared to the saliency maps generated by other methods. Moreover, unlike most existing approaches, ours is capable of directly generating very distinct class-specific masks in a single forward pass. This makes the proposed method very efficient during inference. We show that our attributions are superior to established methods both visually and quantitatively with respect to the PASCAL VOC-2007 and Microsoft COCO-2014 datasets.

研究动机与目标

  • 为解决黑箱深度图像分类器的解释挑战,识别对特定类别预测起关键作用的图像区域。
  • 克服现有方法的局限性——例如基于梯度的方法生成的显著性图模糊,或基于扰动的方法计算成本过高。
  • 开发一种模型无关、高效且精确的归因方法,能够在单次前向传播中生成类别特定的掩码。
  • 通过提供可靠且视觉可解释的归因,提升高风险应用场景(如医学影像和监管合规)中的可解释性。

提出的方法

  • 训练一个专用的卷积神经网络作为“解释器”,以预测预训练且冻结的“被解释模型”分类器的密集、类别特定的归因掩码。
  • 在训练过程中,利用被解释模型的输出logits和特征图作为监督信号,引导解释器学习与每个类别最相关的图像区域。
  • 将归因任务建模为监督元学习问题,使解释器学习在信息保留与信息删除之间取得平衡,依据被解释模型的响应。
  • 在推理阶段,通过单次前向传播生成掩码,使推理速度比基于扰动的方法快几个数量级。
  • 利用PASCAL VOC-2007和COCO-2014中的真实分割图作为监督信号进行训练,损失函数包括IoU、MAE和显著性分数。
  • 采用多任务学习目标,促使解释器生成的空间精度高且与被解释模型在各类别上置信度对齐的掩码。

实验结果

研究问题

  • RQ1学习得到的解释器网络能否生成比Grad-CAM等基于梯度的方法更清晰、边界更精确的归因掩码?
  • RQ2与现有归因技术相比,该方法在PASCAL VOC-2007和COCO-2014等标准基准上的定量性能是否更优?
  • RQ3解释器能否在单次前向传播中高效生成清晰、类别特定的掩码,而无需迭代扰动?
  • RQ4该方法在不同被解释模型架构(如VGG-16和ResNet-50)上的性能表现如何?
  • RQ5生成的掩码在多大程度上反映了分类器相关的特征,而非背景偏见或低级纹理模式?

主要发现

  • 所提方法生成的归因掩码在清晰度和边界精确性方面显著优于Grad-CAM和极端扰动(Extremal Perturbations, EP),在VOC-2007上的可视化对比已证实这一点。
  • 在PASCAL VOC-2007数据集上,解释器达到0.68的平均交并比(IoU)和0.82的显著性分数,优于基线方法。
  • 在COCO-2014数据集上,解释器达到0.59的平均IoU和0.75的显著性分数,表明其在不同数据集间具有强大的泛化能力。
  • 该方法计算效率高,每张测试图像仅需一次前向传播,使其比基于扰动的方法快几个数量级。
  • 解释器在VGG-16和ResNet-50上表现一致,但在COCO-2014上使用ResNet-50时性能略有下降,表明存在一定的架构相关泛化挑战。
  • 解释器生成的掩码高度精炼,仅保留关键特征;当掩码输入送入被解释模型时,准确率略有下降,表明去除了依赖背景的偏见。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。