Skip to main content
QUICK REVIEW

[论文解读] Exploring Counterfactual Explanations Through the Lens of Adversarial Examples: A Theoretical and Empirical Analysis

Martin Pawelczyk, Chirag Agarwal|arXiv (Cornell University)|Jun 18, 2021
Adversarial Robustness in Machine Learning被引用 8
一句话总结

本文建立了反事实解释与对抗性样本之间的理论和实证联系,表明在特定条件下,许多最先进的反事实生成方法在数学上等价或高度相似于对抗性攻击算法。本文推导了解决方案距离的上界,并通过实验验证,基于流形的方法(如 NAE 和 C-CHVAE)产生的输出与反事实解释高度相似,从而对高风险人工智能系统中反事实解释的设计与可信度提出了关键质疑。

ABSTRACT

As machine learning (ML) models become more widely deployed in high-stakes applications, counterfactual explanations have emerged as key tools for providing actionable model explanations in practice. Despite the growing popularity of counterfactual explanations, a deeper understanding of these explanations is still lacking. In this work, we systematically analyze counterfactual explanations through the lens of adversarial examples. We do so by formalizing the similarities between popular counterfactual explanation and adversarial example generation methods identifying conditions when they are equivalent. We then derive the upper bounds on the distances between the solutions output by counterfactual explanation and adversarial example generation methods, which we validate on several real-world data sets. By establishing these theoretical and empirical similarities between counterfactual explanations and adversarial examples, our work raises fundamental questions about the design and development of existing counterfactual explanation algorithms.

研究动机与目标

  • 探究反事实解释与对抗性样本生成方法之间的理论与实证联系。
  • 识别反事实解释与对抗性攻击方法在数学上等价的条件。
  • 为局部线性模型中反事实与对抗性方法生成的解之间的距离建立上界。
  • 使用匹配率和等级相关性等指标,在真实世界数据集上评估输出的实证相似性。
  • 对高风险人工智能应用中反事实解释的可信度与设计提出根本性问题。

提出的方法

  • 形式化反事实与对抗性方法的优化目标,以在共享约束和损失函数下识别等价条件。
  • 为局部线性模型推导反事实解释(如 SCFE、C-CHVAE)与对抗性攻击(如 C&W、DeepFool、NAE)方法之间解的 L2 距离的理论上界。
  • 使用匹配率指标 $d_{\text{match}}$ 评估反事实与对抗性样本之间的实证相似性,设定阈值 $\theta \in \{0.02, 0.05, 0.1\}$。
  • 应用斯皮尔曼等级相关系数 $\rho$ 评估反事实与对抗性方法生成的扰动在特征重要性排序上的一致性。
  • 在真实世界表格数据集(如 COMPAS、Adult、German Credit)上,使用逻辑回归和神经网络分类器进行大量实验。
  • 比较基于流形的方法(NAE、C-CHVAE)与非流形方法(DeepFool、C&W),以评估数据流形约束在解相似性中的作用。

实验结果

研究问题

  • RQ1在何种条件下,反事实解释与对抗性样本生成方法在数学上等价?
  • RQ2反事实解释与对抗性攻击算法生成的解在 L2 距离上有多接近?
  • RQ3反事实与对抗性方法在输入特征重要性上的共识程度如何,以等级相关性衡量?
  • RQ4引入流形约束如何影响反事实与对抗性解之间的相似性?
  • RQ5这些相似性对高风险人工智能系统中反事实解释的可信度与可靠性有何影响?

主要发现

  • SCFE 方法在低阈值($\theta = 0.02$)下与 DeepFool 和 C&W 对抗攻击表现出高匹配率,表明其具有强烈的实证相似性。
  • 基于流形的方法(如 NAE 和 C-CHVAE)产生的解与反事实解释相比,显著优于非流形方法,表现为更高的 $d_{\text{match}}$ 值。
  • 反事实与对抗性方法生成的扰动之间等级相关系数 $\rho$ 最高可达 1.00,表明特征重要性排序近乎完全一致。
  • 理论边界证实,对于局部线性模型,C&W 与 SCFE 解之间的距离处于有界范围内,支持其在特定超参数设置下的等价性。
  • 在特定生成模型配置下,C-CHVAE 与 NAE 被证明是等价的,且解距离有界。
  • 实证结果在多种数据集(包括 COMPAS、Adult 和 German Credit)上验证了理论发现,涵盖逻辑回归与神经网络模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。