Skip to main content
QUICK REVIEW

[论文解读] Counterfactual Evaluation for Explainable AI

Yingqiang Ge, Shuchang Liu|arXiv (Cornell University)|Sep 5, 2021
Explainable Artificial Intelligence (XAI)参考文献 35被引用 6
一句话总结

本文提出了一种反事实评估(CE)框架,通过在显著特征上施加离散和连续扰动生成反事实输入,以评估可解释人工智能方法的忠实度。该方法在有限模型访问条件下,与真实解释的相关性高于基于擦除的度量标准,展现出更优的一致性和更低的偏差,证明了其在忠实度评估中的优越性。

ABSTRACT

While recent years have witnessed the emergence of various explainable methods in machine learning, to what degree the explanations really represent the reasoning process behind the model prediction -- namely, the faithfulness of explanation -- is still an open problem. One commonly used way to measure faithfulness is extit{erasure-based} criteria. Though conceptually simple, erasure-based criterion could inevitably introduce biases and artifacts. We propose a new methodology to evaluate the faithfulness of explanations from the extit{counterfactual reasoning} perspective: the model should produce substantially different outputs for the original input and its corresponding counterfactual edited on a faithful feature. Specially, we introduce two algorithms to find the proper counterfactuals in both discrete and continuous scenarios and then use the acquired counterfactuals to measure faithfulness. Empirical results on several datasets show that compared with existing metrics, our proposed counterfactual evaluation method can achieve top correlation with the ground truth under diffe

研究动机与目标

  • 为解决可解释人工智能中忠实度评估的挑战,现有基于擦除的准则因特征移除而存在固有偏差。
  • 开发一种可泛化的、基于因果推理的评估方法,利用反事实推理评估解释是否真实反映模型行为。
  • 通过用受控扰动替代特征擦除,保留输入结构的同时测试模型敏感性,从而减少评估的模糊性。
  • 在不同模型输出访问级别下(包括仅预测标签或完整概率分布)实现忠实度评估。
  • 使用多个数据集和解释方法,对所提方法与现有基准度量进行实证验证。

提出的方法

  • 提出一种基于两个核心原则的反事实评估框架:在重要特征上施加小扰动应改变预测结果,而在不重要特征上施加大扰动则不应改变预测。
  • 为离散(如类别特征)和连续(如嵌入)输入空间分别设计了生成反事实的独立算法。
  • 将邻近度(Proximity)定义为原始输入与反事实输入之间的平均编辑距离,用于度量扰动幅度。
  • 将有效性(Validity)定义为成功将模型预测切换至目标输出的反事实比例,用于衡量预测敏感性。
  • 引入有效性软度(Validity_soft),即原始类别预测概率的平均变化量,用于捕捉模型置信度的渐变。
  • 将邻近度与有效性/有效性软度结合,形成复合评分 𝒞 或 𝒞_soft,用于在不同模型输出访问条件下评估忠实度。

实验结果

研究问题

  • RQ1反事实推理能否为评估解释忠实度提供比基于擦除的度量更可靠、更少偏差的替代方案?
  • RQ2在有限模型访问条件下,基于反事实的度量与 comprehensiveness 和 sufficiency 等基准度量相比表现如何?
  • RQ3所提方法在不同数据集和解释方法下与真实解释的相关性达到何种程度?
  • RQ4在评估分数中引入邻近度是否能提升忠实度评估的合理性和一致性?
  • RQ5该反事实评估框架能否有效处理离散和连续输入类型?

主要发现

  • 当仅可访问预测标签时,反事实评估分数 𝒞 (disc.) 在 Adults 数据集上与真实解释排名完全一致(100% 一致性),优于 DFR(完全不一致)。
  • 在 Adults 和 Movie Reviews 数据集上,𝒞 (cont.) 相较于最佳基线(comprehensiveness),在 Kendall’s τ 和 Spearman’s ρ 与真实解释的相关性上平均提升了 17.83%。
  • 在 Adults 数据集上,邻近度与有效性软度的结合显著优化了排名结果,表明邻近度感知的评估能增强合理性和一致性。
  • 在多解释评估中,𝒞_soft 在所有测试案例中均与真实解释排名保持 100% 一致性,优于 Random、LIME 和 Anchor。
  • 该方法在不同访问级别下表现出鲁棒性:即使仅提供标签也保持有效,且在可访问概率和嵌入时进一步提升性能。
  • 实证结果表明,𝒞 和 𝒞_soft 与真实解释的相关性达到最优,证实了反事实推理在忠实度评估中优于基于擦除的准则。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。