Skip to main content
QUICK REVIEW

[论文解读] Quantitative Evaluations on Saliency Methods: An Experimental Study

Xiaohui Li, Yuhan Shi|arXiv (Cornell University)|Dec 31, 2020
Explainable Artificial Intelligence (XAI)参考文献 35被引用 14
一句话总结

本文使用五个指标——忠实度、定位、误报、敏感性和稳定性,在 ImageNet、VOC 和 COCO 数据集上对显著性方法进行了全面的定量评估。研究发现没有一种方法在所有指标上都占优,但 Grad-CAM 和 RISE 表现始终出色,作者提出了一个新的 IoSR 指标,并通过指标组合识别出 'Clever Hans' 现象。

ABSTRACT

It has been long debated that eXplainable AI (XAI) is an important topic, but it lacks rigorous definition and fair metrics. In this paper, we briefly summarize the status quo of the metrics, along with an exhaustive experimental study based on them, including faithfulness, localization, false-positives, sensitivity check, and stability. With the experimental results, we conclude that among all the methods we compare, no single explanation method dominates others in all metrics. Nonetheless, Gradient-weighted Class Activation Mapping (Grad-CAM) and Randomly Input Sampling for Explanation (RISE) perform fairly well in most of the metrics. Utilizing a set of filtered metrics, we further present a case study to diagnose the classification bases for models. While providing a comprehensive experimental study of metrics, we also examine measuring factors that are missed in current metrics and hope this valuable work could serve as a guide for future research.

研究动机与目标

  • 提供对广泛使用的显著性方法在多个评估指标下的系统性、定量比较。
  • 在标准化、功能基础的指标下,识别现有 XAI 方法的优势与劣势。
  • 提出一种新的定位指标 IoSR,以更好地捕捉显著性图的紧凑性。
  • 通过组合指标分析检测 'Clever Hans' 现象——即模型预测中存在的虚假相关性。
  • 根据应用特定的优先级,为实践者提供选择合适解释方法的指导。

提出的方法

  • 作者在 ImageNet、VOC 和 COCO 数据集上评估了六种显著性方法——Grad-CAM、RISE、Grad-CAM++、SmoothGrad、Integrated Gradients 和 LRP。
  • 应用了五个功能基础指标:忠实度(通过 iAUC 衡量)、定位(通过点指游戏和 IoSR 衡量)、误报(通过扩展的 BAM 数据集)、对模型权重和类别变化的敏感性,以及在输入扰动下的稳定性。
  • 提出了一项新指标——显著区域交集(IoSR),用于评估显著性图是否紧凑且集中于目标物体周围。
  • 作者扩展了 BAM 数据集,增加了更多物体类别和场景,以更有效地检测误报解释。
  • 应用多指标诊断框架,识别 'Clever Hans' 样例——即模型基于虚假特征做出正确预测的情况。
  • 实验使用 ResNet50 作为黑盒模型,通过反向传播和基于扰动的方法生成解释。

实验结果

研究问题

  • RQ1在多个评估指标下,哪种显著性方法表现最佳,是否存在一种普遍更优的方法?
  • RQ2现有指标——忠实度、定位、误报、敏感性和稳定性——在实践中如何对不同显著性方法进行排序?
  • RQ3显著性方法在多大程度上表现出 'Clever Hans' 行为,即模型依赖于虚假相关性而非真实特征?
  • RQ4多种指标的组合能否有效检测并诊断黑盒模型的故障模式?
  • RQ5方法的内在属性,如分辨率(Grad-CAM)或分散性(RISE),如何影响其在各项指标上的表现?

主要发现

  • 没有一种显著性方法在全部五个评估指标上均达到最优,表明可解释性属性之间存在权衡。
  • Grad-CAM 和 RISE 在忠实度、定位、敏感性和稳定性方面表现一致出色,但 Grad-CAM 的误报率更高,而 RISE 的 IoSR 得分较低。
  • 所提出的 IoSR 指标有效捕捉了显著性图的紧凑性,揭示出 RISE 生成的解释比 Grad-CAM 更为分散。
  • 扩展后的 BAM 数据集使误报解释的检测成为可能,特别是在模型依赖于 'motorbike' 等虚假特征进行 'person' 分类的情况下。
  • 多指标诊断框架成功在 VOC 和 COCO 数据集上识别出 'Clever Hans' 样例,例如模型基于 'horse' 或 'motorbike' 的存在预测 'person'。
  • 在真实测试数据中观察到由虚假相关性导致的误报预测,例如模型基于无关特征将 'motorbike' 错误分类为 'person'。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。