Skip to main content
QUICK REVIEW

[论文解读] One Explanation is Not Enough: Structured Attention Graphs for Image Classification

Vivswan Shitole, Fuxin Li|arXiv (Cornell University)|Nov 12, 2020
Explainable Artificial Intelligence (XAI)被引用 14
一句话总结

本文提出结构化注意力图(SAGs),一种新颖的可视化方法,通过束搜索发现多种高置信度、局部化的注意力图,以捕捉图像分类器决策的多重解释。SAGs 将这些注意力图表示为有向无环图,展示区域间的依赖关系及置信度变化,显著提升了用户在回答反事实问题时的准确性,相较于单一显著性图有明显优势。

ABSTRACT

Attention maps are a popular way of explaining the decisions of convolutional networks for image classification. Typically, for each image of interest, a single attention map is produced, which assigns weights to pixels based on their importance to the classification. A single attention map, however, provides an incomplete understanding since there are often many other maps that explain a classification equally well. In this paper, we introduce structured attention graphs (SAGs), which compactly represent sets of attention maps for an image by capturing how different combinations of image regions impact a classifier's confidence. We propose an approach to compute SAGs and a visualization for SAGs so that deeper insight can be gained into a classifier's decisions. We conduct a user study comparing the use of SAGs to traditional attention maps for answering counterfactual questions about image classifications. Our results show that the users are more correct when answering comparative counterfactual questions based on SAGs compared to the baselines.

研究动机与目标

  • 探究图像分类器决策是否存在超越单一显著性图的多种局部化、高置信度解释。
  • 开发一种可扩展的方法,以发现多样且紧凑的注意力图,从而以高置信度解释同一分类结果。
  • 设计一种可视化技术,有效传达多种解释之间的共性与差异结构。
  • 评估SAGs是否在反事实推理任务中相较于标准显著性图,提升用户对模型决策的理解与判断能力。
  • 评估图结构与交互高亮对用户在理解模型决策时的表现与信心的影响。

提出的方法

  • 在图像块上使用束搜索,系统性地发现给定图像的多种高置信度、局部化注意力图。
  • 将结构化注意力图(SAGs)构建为有向无环图,其中节点表示注意力图,边编码在移除块后区域的包含关系与置信度下降。
  • 采用多样化采样方法,选取紧凑且具代表性的注意力图集合用于SAG构建,确保覆盖不同高置信度解释。
  • 通过置信度分数与区域边界可视化SAGs,展示子区域如何对分类置信度产生贡献。
  • 在SAGs中集成交互高亮功能,使用户能够探索影响分类决策的最关键图像区域。
  • 将该方法应用于VGGNet在ImageNet上的模型,并通过大规模用户研究,将SAGs与Grad-CAM和I-GOS基线进行比较评估。

实验结果

研究问题

  • RQ1对于给定的分类任务,每张图像存在多少种不同、局部化且高置信度的注意力图?
  • RQ2束搜索是否能高效发现紧凑且多样的注意力图,以高置信度解释同一预测结果?
  • RQ3与单一显著性图相比,SAGs等结构化可视化是否能提升用户对CNN决策的理解?
  • RQ4SAGs在多大程度上提升了用户在回答图像分类相关比较性反事实问题时的准确性?
  • RQ5在SAGs中,图结构与交互高亮哪一成分对提升用户表现更为关键?

主要发现

  • 当不允许重叠时,平均每张图像存在2种不同的高置信度解释;当重叠限制在最多一个块(约占图像面积的2%)时,平均存在5种。
  • 80%的ImageNet图像至少存在一种解释覆盖面积不超过20%的图像区域,表明紧凑且局部化的解释非常普遍。
  • 在低分辨率下,束搜索在发现紧凑解释方面优于基于梯度的方法(如Grad-CAM和I-GOS)。
  • 与Grad-CAM和I-GOS相比,用户在使用SAGs时回答反事实问题的准确率显著提高(p < 0.0001)。
  • 使用SAGs时,用户在正确答案上表现出更高的信心,错误答案上则信心更低,表明其心理模型与模型行为的对齐更佳。
  • 消融研究证实,SAGs中的图结构与交互高亮均不可或缺;移除任一成分均显著降低性能(p < 0.0001)

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。