Skip to main content
QUICK REVIEW

[论文解读] The Dangers of Post-hoc Interpretability: Unjustified Counterfactual Explanations

Thibault Laugel, Marie‐Jeanne Lesot|arXiv (Cornell University)|Jul 22, 2019
Explainable Artificial Intelligence (XAI)被引用 4
一句话总结

本文提出了一种基于与训练数据路径连通性的后霍反事实解释的合理性标准,并提出了一项检测不合理反事实示例的测试。研究发现,最先进方法在脆弱实例上高达37%的情况下会产生不合理的反事实解释,揭示了其对真实数据忠实度的关键缺陷。

ABSTRACT

Post-hoc interpretability approaches have been proven to be powerful tools to generate explanations for the predictions made by a trained black-box model. However, they create the risk of having explanations that are a result of some artifacts learned by the model instead of actual knowledge from the data. This paper focuses on the case of counterfactual explanations and asks whether the generated instances can be justified, i.e. continuously connected to some ground-truth data. We evaluate the risk of generating unjustified counterfactual examples by investigating the local neighborhoods of instances whose predictions are to be explained and show that this risk is quite high for several datasets. Furthermore, we show that most state of the art approaches do not differentiate justified from unjustified counterfactual examples, leading to less useful explanations.

研究动机与目标

  • 基于与训练数据的连续连通性,定义反事实解释的合理性标准。
  • 开发一项测试,以评估后霍可解释性中生成不合理反事实示例的风险。
  • 评估现有后霍反事实方法在生成不合理解释方面的脆弱性。
  • 证明当前方法在模型和真实数据忠实度方面常常被破坏。
  • 倡导在未来可解释性方法中整合训练数据连通性。

提出的方法

  • 提出合理反事实解释(JCF)的形式化定义,即位于与训练样本相同预测类别连通区域内的解释。
  • 引入验证程序(VE),检查反事实示例是否能通过ε-链与同预测类别的训练样本相连。
  • 使用以最近邻为中心的超球面层,扩展对连通训练样本的搜索空间。
  • 将VE程序应用于HCLS、Growing Spheres和LORE生成的反事实示例,评估其合理性得分(J_E(x))。
  • 通过多次实例和运行的平均合理性得分(J̄)来衡量方法的鲁棒性。
  • 采用风险评分(R_x)识别局部高风险区域中生成不合理反事实示例的可能性(R_x ≥ 0.25)。

实验结果

研究问题

  • RQ1能否通过连续路径将后霍反事实解释与训练数据连接,从而实现其合理性?
  • RQ2后霍方法在高风险局部邻域中生成不合理反事实示例的风险如何?
  • RQ3最先进后霍反事实方法在生成合理解释方面的表现如何?
  • RQ4分类器复杂度或数据结构在多大程度上影响反事实解释的合理性?
  • RQ5在相同的合理性框架下,能否分析对抗样本的连通性?

主要发现

  • 在高风险实例(R_x ≥ 0.25)上,最先进方法生成的合理反事实比例(J̄)低至63%。
  • HCLS在合理性表现上略优于Growing Spheres,可能因其更关注分类置信度而非距离接近度。
  • LORE在Boston Random Forest和Recidivism数据集上实现了100%的合理性,表明在特定场景下表现优异。
  • 不同数据集间的合理性比率差异显著:Iris数据集上HCLS与GS均为63%,而BostonSVC上HCLS达到95%。
  • 研究证实,后霍反事实方法由于缺乏真实数据连通性,本质上容易生成不合理解释。
  • 结果表明,当前后霍方法无法可靠保证对模型和训练数据的忠实度,未来解释生成必须整合训练数据连通性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。