Skip to main content
QUICK REVIEW

[论文解读] Towards a Unified Evaluation of Explanation Methods without Ground Truth

Hao Zhang, Jiayi Chen|arXiv (Cornell University)|Nov 20, 2019
Explainable Artificial Intelligence (XAI)参考文献 48被引用 7
一句话总结

本文提出了一种统一的、无需真实标签的解释方法评估框架,用于深度神经网络的解释方法,采用四种度量标准——像素级别的偏差、无法解释的特征分量、对空间掩码的鲁棒性以及相互验证——应用于九种基准方法。其主要贡献在于实现了对归因图的客观、可复现且全面的评估,而无需依赖人工标注或合成的真实标签解释。

ABSTRACT

This paper proposes a set of criteria to evaluate the objectiveness of explanation methods of neural networks, which is crucial for the development of explainable AI, but it also presents significant challenges. The core challenge is that people usually cannot obtain ground-truth explanations of the neural network. To this end, we design four metrics to evaluate explanation results without ground-truth explanations. Our metrics can be broadly applied to nine benchmark methods of interpreting neural networks, which provides new insights of explanation methods.

研究动机与目标

  • 解决由于缺乏真实标签归因而导致深度神经网络解释方法缺乏客观、可靠评估的问题。
  • 克服现有度量标准依赖人工判断、合成数据集或对模型行为假设的局限性。
  • 开发一种可推广的评估框架,适用于多种模型、数据集和解释方法,且无需真实标签解释。
  • 确保评估聚焦于归因图的客观性、完整性、鲁棒性和一致性(共性)。
  • 通过定量、可解释且可复现的度量标准,实现对解释方法的公平比较。

提出的方法

  • 定义像素级别的偏差度量标准,以量化归因图在多大程度上准确反映单个像素对模型输出的真实贡献。
  • 引入一种度量标准,通过测量在基于归因的掩码处理后,仍显著影响模型预测的被掩码像素比例,来量化无法解释的特征分量。
  • 提出一种基于空间掩码扰动的鲁棒性度量标准,衡量归因图在输入修改下保持稳定的一致性。
  • 设计一种相互验证度量标准,通过评估不同解释方法在相同输入上分配相似归因模式的频率,来评估其一致性。
  • 在多个模型(ResNet、VGG、AlexNet)和数据集(CIFAR-10、VOC2012)上,将这些度量标准应用于九种广泛使用的解释方法(如LRP、Grad-CAM、LIME、DeepSHAP)。
  • 通过数值评估和可视化(如相互验证的热力图)比较方法性能,而无需依赖人工标注的解释。

实验结果

研究问题

  • RQ1如何在无真实标签解释的情况下,客观评估归因图的准确性?
  • RQ2不同解释方法在多大程度上捕捉了深度神经网络中完整且非冗余的特征分量?
  • RQ3解释方法对输入中的空间扰动(如掩码或噪声)有多强的鲁棒性?
  • RQ4不同解释方法在相同输入上对显著区域的一致性如何?
  • RQ5能否识别出一种统一的、通用的评估框架,适用于多种模型、数据集和解释技术?

主要发现

  • LRP、GI和GB在多种模型上表现出最低的像素级别偏差,其中LRP在VGG-16/19(0.256)和ResNet(0.258)上于VOC2012数据集上达到最低偏差。
  • LIME、GB和Pert解释了最多的特征分量,其中LIME因基于超像素的归因而表现出较高变异性,且在CIFAR-10上性能不一致。
  • GB和Grad-CAM在空间掩码下表现出最高的鲁棒性,其中GB在VOC2012-ResNet101上记录最低的非鲁棒性得分(0.248)。
  • 相互验证分析显示LRP、GI和DeepSHAP之间具有高度一致性,表现为低相互验证得分(例如,LRP-GI在VOC2012-ResNet101上的得分为0.308),表明其高度一致。
  • 由于基于特征级别的归因,CAM和Grad-CAM无法在像素级别偏差度量标准下进行评估;LRP因相关传播规则未定义,未在ResNet上进行评估。
  • 所提出的度量标准实现了对多样化模型和方法的一致、定量评估,结果显示GB和LRP在多个维度上优于其他方法,且无需真实标签注释。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。