Skip to main content
QUICK REVIEW

[论文解读] Explainable Image Classification with Evidence Counterfactual

Tom Vermeire, David Martens|arXiv (Cornell University)|Apr 16, 2020
Explainable Artificial Intelligence (XAI)被引用 4
一句话总结

本文提出 SEDC 和 SEDC-T,这两种是针对图像分类任务的、与模型无关的实例级解释方法,通过识别移除后会改变模型预测结果的最小图像区域集合,生成视觉反事实解释。该方法克服了 LIME、SHAP 和 LRP 等特征重要性方法的局限性,生成大小最优、与特征相关的多类别解释,在 15 秒内对误分类图像的成功率达到 86%。

ABSTRACT

The complexity of state-of-the-art modeling techniques for image classification impedes the ability to explain model predictions in an interpretable way. Existing explanation methods generally create importance rankings in terms of pixels or pixel groups. However, the resulting explanations lack an optimal size, do not consider feature dependence and are only related to one class. Counterfactual explanation methods are considered promising to explain complex model decisions, since they are associated with a high degree of human interpretability. In this paper, SEDC is introduced as a model-agnostic instance-level explanation method for image classification to obtain visual counterfactual explanations. For a given image, SEDC searches a small set of segments that, in case of removal, alters the classification. As image classification tasks are typically multiclass problems, SEDC-T is proposed as an alternative method that allows specifying a target counterfactual class. We compare SEDC(-T) with popular feature importance methods such as LRP, LIME and SHAP, and we describe how the mentioned importance ranking issues are addressed. Moreover, concrete examples and experiments illustrate the potential of our approach (1) to obtain trust and insight, and (2) to obtain input for model improvement by explaining misclassifications.

研究动机与目标

  • 为解决现有基于特征重要性的解释方法在图像分类中的局限性,例如解释大小不优、未考虑特征依赖性,以及仅关注单一类别。
  • 开发与模型无关、实例级的解释方法,为复杂图像分类器生成人类可理解的视觉反事实解释。
  • 通过揭示误分类的原因及导致错误预测的证据,支持信任建立、提供洞察并促进模型改进。
  • 通过提供对比性、可操作的解释,支持符合 GDPR 中“解释权”等监管要求。
  • 通过实证实验评估反事实解释在真实世界误分类场景中的有效性。

提出的方法

  • SEDC 识别一组最小的图像区域,其移除会使模型预测为不同类别,从而形成视觉反事实解释。
  • SEDC-T 扩展了 SEDC,允许用户指定目标类别,从而为误分类实例生成目标导向的反事实解释。
  • 该方法在分割后的图像区域上使用搜索算法,迭代测试哪些区域组合的移除会导致预测结果发生变化。
  • 图像分割使用现成的方法(如 SLIC)完成,通过区域替换来模拟移除效果以进行搜索。
  • 该方法与模型无关,无需访问模型架构或梯度信息,适用于任何黑箱图像分类器。
  • 解释效果基于移除的最小区域数量及预测置信度的变化进行评估。

实验结果

研究问题

  • RQ1与传统基于特征重要性的方法相比,SEDC 和 SEDC-T 生成的视觉反事实解释是否能显著提升复杂图像分类模型的可解释性?
  • RQ2SEDC-T 在合理时间内成功生成将模型预测更改为指定目标类别的反事实解释的程度如何?
  • RQ3SEDC 和 SEDC-T 如何解决现有解释方法的局限性,如解释大小不优和缺乏多类别考量?
  • RQ4在误分类情况下,SEDC-T 是否能识别出导致错误预测的判别性证据,并指导模型改进?
  • RQ5SEDC-T 未能在时间限制内达到目标类别的原因是什么?这些原因与图像内容和标注有何关联?

主要发现

  • 在 15 秒搜索时间内,SEDC-T 在 2,121 个误分类图像中成功找到正确目标类别的比例达到 86%(1,831 / 2,121)。
  • 在 290 个未达到目标的案例中,有 289 个案例的搜索仍产生了使目标类别与预测类别得分距离更远的扰动,表明已向目标方向推进。
  • 失败案例通常源于标注模糊——例如,桌面电脑或书桌场景中出现老鼠——此时正确类别在上下文中具有合理性,难以将错误类别的证据孤立出来。
  • 在某些情况下,即使仅保留实际物体(如老鼠)所在的区域,模型仍无法预测正确类别,表明存在更深层次的模型偏差或架构限制。
  • 该方法成功识别出误分类中的判别性证据,例如左轮手枪的弹巢,可为数据增强和模型微调提供依据。
  • 建议开展用户研究,以进一步验证 SEDC-T 在真实决策场景中的可解释性与可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。