Skip to main content
QUICK REVIEW

[论文解读] On Generating Plausible Counterfactual and Semi-Factual Explanations for Deep Learning

Eoin M. Kenny, Mark T. Keane|arXiv (Cornell University)|Sep 10, 2020
Explainable Artificial Intelligence (XAI)被引用 6
一句话总结

本文提出了 PIECE,一种用于计算机视觉中深度学习模型的合理反事实与准反事实解释的新方法。通过仅修改图像中‘异常’特征以使其与反事实类别对齐,PIECE 生成高度合理、改动极小的解释,在多种指标(包括 L1 距离和模型置信度分数)下,其反事实与准反事实合理性均优于现有方法。

ABSTRACT

There is a growing concern that the recent progress made in AI, especially regarding the predictive competence of deep learning models, will be undermined by a failure to properly explain their operation and outputs. In response to this disquiet counterfactual explanations have become massively popular in eXplainable AI (XAI) due to their proposed computational psychological, and legal benefits. In contrast however, semifactuals, which are a similar way humans commonly explain their reasoning, have surprisingly received no attention. Most counterfactual methods address tabular rather than image data, partly due to the nondiscrete nature of the latter making good counterfactuals difficult to define. Additionally generating plausible looking explanations which lie on the data manifold is another issue which hampers progress. This paper advances a novel method for generating plausible counterfactuals (and semifactuals) for black box CNN classifiers doing computer vision. The present method, called PlausIble Exceptionality-based Contrastive Explanations (PIECE), modifies all exceptional features in a test image to be normal from the perspective of the counterfactual class (hence concretely defining a counterfactual). Two controlled experiments compare this method to others in the literature, showing that PIECE not only generates the most plausible counterfactuals on several measures, but also the best semifactuals.

研究动机与目标

  • 解决 XAI 领域对准反事实解释关注不足的问题,尽管其在人类推理中具有心理与实际优势。
  • 克服因像素具有非离散、高维特性而难以生成图像数据合理反事实的挑战。
  • 开发一种生成对比性解释(反事实与准反事实)的方法,使其位于数据流形上,并仅进行最小且有意义的特征修改。
  • 为黑箱 CNN 分类器提供事后解释,无需模型内省或访问内部权重。
  • 证明准反事实解释——通过‘即使’推理方式——在增强可解释性与减少负面情绪反应方面,可与反事实解释具有同等效果。

提出的方法

  • 使用统计显著性(α = 0.05)基于真实类别与反事实类别之间的激活差异,识别测试图像中的‘异常’特征。
  • 仅修改这些异常特征,使其从反事实类别的视角变为‘正常’,从而生成反事实样本。
  • 通过潜在空间优化过程,确保生成的反事实在 L2 距离上接近原始图像,以保持合理性。
  • 通过保留原始类别但应用相同修改过程来生成准反事实,从而展示在不改变预测结果的前提下,哪些特征可被改变。
  • 利用深度神经网络的特征表示(通过潜在空间)引导生成过程,确保输出保持在数据流形内。
  • 应用多种合理性度量——包括 L1 距离、模型置信度(MC-Dropout)、最近邻距离以及图像质量评分(IM1/IM2)——以评估生成的解释。

实验结果

研究问题

  • RQ1能否开发一种方法,为基于图像的深度学习模型生成合理反事实解释,特别是在数据非离散的情况下?
  • RQ2通过修改异常特征但不改变预测类别而生成的准反事实解释,是否比反事实解释更具可解释性与心理自然性?
  • RQ3不同解释生成方法在合理性方面如何比较,以 L1 距离、模型置信度和最近邻距离为度量?
  • RQ4在准反事实解释中,合理性与特征修改数量之间是否存在权衡?PIECE 如何管理这一权衡?
  • RQ5同一框架能否使用统一的异常性基础机制同时生成反事实与准反事实解释?

主要发现

  • PIECE 生成的反事实显著优于基线方法,L1 距离得分更高,且模型置信度(MC-Dropout)与最近邻距离(NN-Dist)指标更优。
  • 在准反事实生成中,PIECE 显著优于最小编辑方法,L1 距离更高(AD > 2.5,p < .029),表明特征修改更具意义与区分度。
  • 所有方法在更远距离下生成的准反事实表现更优,但 PIECE 在所有测试距离下均持续取得最佳结果(AD > 3.3,p < .015)。
  • MC-Dropout 与 NN-Dist 指标显示出明显权衡:随着准反事实的区分度提高(L1 距离增大),其模型置信度与合理性得分下降,表明需在区分度与忠实度之间取得平衡。
  • IM1 与 IM2 指标在逐步修改特征时无显著变化,表明其对解释质量变化的敏感性低于 MC-Mean、MC-STD 与 NN-Dist。
  • 该方法成功使用同一框架生成了反事实与准反事实解释,展示了其多功能性及在 XAI 领域更广泛应用的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。