Skip to main content
QUICK REVIEW

[论文解读] SS-CAM: Smoothed Score-CAM for Sharper Visual Feature Localization

Haofan Wang, Rakshit Naidu|arXiv (Cornell University)|Jun 25, 2020
Explainable Artificial Intelligence (XAI)参考文献 28被引用 52
一句话总结

SS-CAM 通过对激活图进行平滑处理,生成更锋利、更加集中定位的对象特征,从而提升在 ImageNet 上的保真度与定位。

ABSTRACT

Interpretation of the underlying mechanisms of Deep Convolutional Neural Networks has become an important aspect of research in the field of deep learning due to their applications in high-risk environments. To explain these black-box architectures there have been many methods applied so the internal decisions can be analyzed and understood. In this paper, built on the top of Score-CAM, we introduce an enhanced visual explanation in terms of visual sharpness called SS-CAM, which produces centralized localization of object features within an image through a smooth operation. We evaluate our method on the ILSVRC 2012 Validation dataset, which outperforms Score-CAM on both faithfulness and localization tasks.

研究动机与目标

  • 在高风险场景中为 CNN 决策提供可解释的解释动机。
  • 在 Score-CAM 的基础上通过应用平滑实现更锋利、集中的定位方法。
  • 在 ILSVRC 2012 上评估该方法,以考察保真度、定位和人类信任。
  • 将 SS-CAM 与 Grad-CAM、Grad-CAM++、Smooth Grad-CAM++ 和 Score-CAM 在多项指标上进行比较。

提出的方法

  • 通过对嘈杂样本进行平滑以获得稳定的激活权重,扩展 Score-CAM。
  • 引入两种平滑策略:特征空间平滑(type1)和输入空间平滑(type2)。
  • 定义 Channel-wise Increase of Confidence (CIC) 以量化激活图的重要性。
  • 将平滑的 CIC 权重作为权重,对激活图进行 ReLU 加权求和以得到最终归因。
  • 对激活图进行归一化并上采样,然后对 N 个嘈杂样本的分数取平均以获得 alpha_k。
  • 给出两条 alpha_k 的方程:(type1)alpha_k = (1/N) sum C(M) 其中 M = sum_N (X0 * (A_l^k + N(0,σ))); (type2)alpha_k = (1/N) sum C(M) 其中 M = sum_N ((X0 * A_l^k) + N(0,σ))。
  • Normalization: s(A_l^k) = (A_l^k - min(A_l^k)) / (max(A_l^k) - min(A_l^k)).

实验结果

研究问题

  • RQ1SS-CAM 是否比 Score-CAM 和其他 CAM 基于方法产生更尖锐、定位更集中的归因图?
  • RQ2平滑策略是否在不产生过高计算成本的前提下改善保真度、定位和人类可解释性?
  • RQ3SS-CAM 的变体在如删除/插入曲线和基于能量的指向游戏等标准指标上的表现如何?

主要发现

  • 与 Score-CAM 相比,SS-CAM 变体在定性可视化中展示了更好的定位和更锋利的归因图。
  • 在用 VGG-16 对 2000 张 ILSVRC-2012 图像进行保真度测试时,SS-CAM 变体展现出与 Grad-CAM/Grad-CAM++ 相当或更高的平均下降(Average Drop)以及更高或可比的平均信心增加(Average Increase in Confidence)。
  • 基于能量的指向游戏结果表明 SS-CAM 在 VGG-16 和 ResNet-18 上提供更好或可比的定位,与 Score-CAM 相比有若干提升。
  • 人类信任评估显示 SS-CAM(2) 相对于其他方法具有更高的可解释性。
  • SS-CAM 的插入曲线在像素被插入时表现出显著的分数提升,表明其解释性用途强。
  • SS-CAM(2) 在忠实性和尖锐定位之间通常取得较有利的平衡,尽管 SS-CAM(1) 在某些指标上有时超过 Score-CAM。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。