QUICK REVIEW
[论文解读] Issues with post-hoc counterfactual explanations: a discussion
Thibault Laugel, Marie‐Jeanne Lesot|arXiv (Cornell University)|Jun 11, 2019
Explainable Artificial Intelligence (XAI)参考文献 19被引用 21
一句话总结
本文识别出事后型反事实解释中的三个关键缺陷:接近性、连通性与稳定性。文章指出,由于缺乏训练数据访问权限,事后型方法常常生成不具局部忠实性、与真实数据脱节或在输入微小扰动下不稳定的解释,从而削弱其在现实应用中的可解释性与可信度。
ABSTRACT
Counterfactual post-hoc interpretability approaches have been proven to be useful tools to generate explanations for the predictions of a trained blackbox classifier. However, the assumptions they make about the data and the classifier make them unreliable in many contexts. In this paper, we discuss three desirable properties and approaches to quantify them: proximity, connectedness and stability. In addition, we illustrate that there is a risk for post-hoc counterfactual approaches to not satisfy these properties.
研究动机与目标
- 识别并分析应定义高质量反事实解释的三个关键需求——接近性、连通性和稳定性。
- 证明缺乏训练数据访问权限的事后型反事实方法往往无法满足这些标准。
- 论证事后范式中缺乏真实数据与模型结构,导致解释不可靠、具有误导性或不可操作。
- 推动重新评估当前的事后型方法,并倡导在解释过程中引入训练数据以提升解释质量。
提出的方法
- 将反事实解释形式化为实例 $ E(x) $,其需满足:与输入 $ x $ 接近,属于不同类别($ f(x) \neq f(E(x)) $),且在无模型或数据访问权限的情况下生成。
- 提出一种连通性度量 $ C(E(x)) $,定义为 $ E(x) $ 的 $ \epsilon $-邻域中属于与 $ E(x) $ 相同类别的样本比例,其中 $ C(E(x)) = 0 $ 表示与真实数据无连通性。
- 采用 Alvarez Melis & Jaakkola (2018) 提出的稳定性度量 $ \bar{L}_X(x) $,用于衡量在局部邻域内,解释变化与输入变化的比率。
- 在合成数据集与真实数据集(如 Iris)上进行实证评估,量化 HCLS 与 GS 等事后型方法在接近性、连通性与稳定性方面的违反情况。
- 通过可视化与定量分析表明,在一个合成问题中,高达 17.8% 的反事实解释与真实数据完全脱节。
- 提出尽管违背事后型假设,仍应使用训练数据以提升反事实解释质量。
实验结果
研究问题
- RQ1事后型反事实解释在多大程度上无法保持与原始样本及决策边界的接近性?
- RQ2事后型反事实解释在多大程度上无法与真实训练数据保持连通?可量化该现象的度量有哪些?
- RQ3为何稳定性是反事实解释中的问题性标准?它与模型鲁棒性有何不同?
- RQ4在无训练数据访问权限的前提下,事后型反事实方法能否生成既忠实又可操作的解释?
- RQ5脱离真实数据或不稳定的反事实解释对现实世界人工智能系统中用户信任与决策过程有何影响?
主要发现
- 在一个具有两个孤立决策区域的合成问题中,HCLS 与 GS 生成的 17.8% 的反事实解释未与任何真实训练实例连通,其 $ C(E(x)) = 0 $。
- 事后型反事实方法可能生成位于特征空间中数据稀疏或不存在区域的解释,从而削弱其在现实世界中的可操作性。
- 如 $ \bar{L}_X(x) $ 这类稳定性度量可能反映分类器决策边界本身的自然变化,而非解释器的缺陷,因此稳定性作为解释质量的代理指标较弱。
- 即使解释完全错误(例如对所有输入生成相同的错误解释),高度稳定的解释仍可获得较高的稳定性评分,表明稳定性本身不足以保证解释的可信度。
- 事后型设定中缺乏对训练数据的访问,从根本上限制了确保反事实解释基于真实数据分布的能力。
- 本文结论认为,尽管违背事后型假设,仍需将训练数据纳入解释过程,方能实现可靠、忠实且有用的反事实解释。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。