Skip to main content
QUICK REVIEW

[论文解读] Towards Interpretable Semantic Segmentation via Gradient-weighted Class Activation Mapping

Kira Vinogradova, Alexandr Dibrov|arXiv (Cornell University)|Feb 26, 2020
Explainable Artificial Intelligence (XAI)参考文献 7被引用 10
一句话总结

本文提出 seg-grad-cam,一种基于梯度的方法,通过生成类特定的热力图来突出显示预测中像素级别的相关性,将 Grad-CAM 扩展至语义分割任务。该方法计算中间特征图的梯度加权激活,生成与真实分割掩码对齐的可解释可视化结果,尤其在使用 U-Net 架构的瓶颈层特征时表现更优。

ABSTRACT

Convolutional neural networks have become state-of-the-art in a wide range of image recognition tasks. The interpretation of their predictions, however, is an active area of research. Whereas various interpretation methods have been suggested for image classification, the interpretation of image segmentation still remains largely unexplored. To that end, we propose SEG-GRAD-CAM, a gradient-based method for interpreting semantic segmentation. Our method is an extension of the widely-used Grad-CAM method, applied locally to produce heatmaps showing the relevance of individual pixels for semantic segmentation.

研究动机与目标

  • 解决深度学习模型中语义分割任务缺乏可解释性方法的问题。
  • 将广泛使用的 Grad-CAM 技术从图像分类任务扩展至像素级语义分割任务。
  • 生成局部化、类特定的热力图,以解释哪些图像区域对单个像素的预测贡献最大。
  • 评估中间特征层(尤其是瓶颈层)在生成有意义视觉解释方面的有效性。
  • 为任何语义分割网络(包括 U-Net)提供一种灵活的、基于梯度的解释框架。

提出的方法

  • 该方法通过将全局 logits $ y^c $ 替换为感兴趣区域 $ \mathcal{M} $ 上的 logits 总和 $ \sum_{(i,j)\in\mathcal{M}} y_{ij}^c $,对 Grad-CAM 进行改进,从而实现对单像素或单对象的解释。
  • 对每个特征图 $ A^k $ 计算梯度权重 $ \alpha_c^k = \frac{1}{N} \sum_{u,v} \frac{\partial y^c}{\partial A_{uv}^k} $,其中梯度从 logits 总和反向传播至特征图。
  • 通过 $ L^c = \mathrm{ReLU}\left( \sum_k \alpha_c^k A^k \right) $ 生成热力图,突出显示对类别 $ c $ 预测有正向贡献的空间区域。
  • 该方法支持灵活选择 $ \mathcal{M} $,包括单个像素、目标实例或所有图像像素,从而实现局部或全局可解释性。
  • 它利用中间层的特征图,特别是 U-Net 的瓶颈层特征,这些特征图被证明能生成比解码器层更具有信息量的热力图。
  • 该方法在最终热力图上使用 ReLU 激活,以抑制负向贡献,聚焦于正向激活区域。

实验结果

研究问题

  • RQ1基于梯度的类激活映射能否有效扩展至语义分割任务,其中预测是按像素进行而非全局进行?
  • RQ2在 U-Net 架构中,哪些中间特征层能生成最具语义意义的热力图用于解释?
  • RQ3seg-grad-cam 生成的热力图在空间对齐性和相关性方面与真实分割掩码相比如何?
  • RQ4选择 $ \mathcal{M} $(如单个像素或所有像素)是否会影响生成热力图的可解释性和合理性?
  • RQ5seg-grad-cam 能否揭示上下文依赖关系,例如在预测天空时突出显示树木,表明模型推理超越了局部特征?

主要发现

  • 从 U-Net 架构的瓶颈层特征生成的热力图与真实分割掩码对齐性更强,且语义意义更明确,优于解码器层生成的热力图。
  • 该方法能有效突出相关上下文区域,例如在预测天空时突出显示树木,表明其捕捉了高层语义依赖关系。
  • 早期卷积层生成的热力图呈现边缘状结构,与它们检测低级特征的角色一致。
  • 随着特征图从瓶颈层向解码器层推进,生成的热力图逐渐趋近于最终的分割掩码,表明特征逐步细化。
  • 热力图生成过程可突出显示所选像素感受野之外的区域,这是由于在整个图像上对特征图进行了全局加权。
  • 该方法具有灵活性和泛化能力,通过调整集合 $ \mathcal{M} $,可支持对单个像素、目标实例或整个图像的解释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。