Skip to main content
QUICK REVIEW

[论文解读] Consistent Counterfactuals for Deep Models

Emily Black, Zifan Wang|arXiv (Cornell University)|Oct 6, 2021
Explainable Artificial Intelligence (XAI)参考文献 57被引用 7
一句话总结

本文提出稳定邻域搜索(SNS),一种在权重初始化和数据扰动等小规模训练变化下,为深度模型生成一致反事实解释的方法。通过优先选择局部Lipschitz常数较低且预测置信度较高的区域中的反事实,SNS在保持低反事实成本的同时,显著提升了相似模型之间的稳定性,相较于现有方法在表格基准测试中展现出更高的稳定性和可靠性。

ABSTRACT

Counterfactual examples are one of the most commonly-cited methods for explaining the predictions of machine learning models in key areas such as finance and medical diagnosis. Counterfactuals are often discussed under the assumption that the model on which they will be used is static, but in deployment models may be periodically retrained or fine-tuned. This paper studies the consistency of model prediction on counterfactual examples in deep networks under small changes to initial training conditions, such as weight initialization and leave-one-out variations in data, as often occurs during model deployment. We demonstrate experimentally that counterfactual examples for deep models are often inconsistent across such small changes, and that increasing the cost of the counterfactual, a stability-enhancing mitigation suggested by prior work in the context of simpler models, is not a reliable heuristic in deep networks. Rather, our analysis shows that a model's local Lipschitz continuity around the counterfactual is key to its consistency across related models. To this end, we propose Stable Neighbor Search as a way to generate more consistent counterfactual explanations, and illustrate the effectiveness of this approach on several benchmark datasets.

研究动机与目标

  • 研究在权重初始化或留一法数据变化等微小训练差异下,深度模型中反事实解释的一致性。
  • 评估增加反事实成本(来自简单模型的启发式方法)是否能提升深度网络中的一致性。
  • 识别在模型扰动下反事实稳定性的可靠指标,特别是在深度学习设置中。
  • 开发并验证一种新方法,用于在相似模型变体中生成既一致又成本低廉的反事实。

提出的方法

  • 提出稳定邻域搜索(SNS),一种基于搜索的方法,用于在输入空间中局部Lipschitz常数较低且模型置信度较高的区域中识别反事实。
  • 定义并计算候选反事实周围的局部Lipschitz常数,以估计对模型权重和数据扰动的敏感性。
  • 利用模型输出logits中的置信度分数,优先选择对模型参数微小变化具有鲁棒性的反事实。
  • 将SNS作为后处理步骤集成到现有反事实生成方法(如min-ℓ₁、min-ℓ₂、PGD)之上,以提升一致性。
  • 将搜索目标表述为在最小化与原始输入距离的同时,最大化置信度并最小化局部Lipschitz常数。
  • 在100次使用不同随机种子和数据子集的重新训练运行下,对SNS在基准表格数据集(德国信贷、癫痫发作、CTG、华法林、HELOC、台湾信贷)上进行实证评估。

实验结果

研究问题

  • RQ1标准方法在微小训练变化下生成的反事实解释在不同深度模型中的一致性如何?
  • RQ2在深度网络中,增加反事实成本是否能可靠地提升其在相似模型间的一致性?
  • RQ3哪些模型特性——如Lipschitz连续性和预测置信度——能预测在模型扰动下的反事实一致性?
  • RQ4一种优先选择低局部Lipschitz常数和高置信度的搜索策略,是否能产生比仅最小化成本更一致的反事实?
  • RQ5与现有反事实生成技术相比,所提出的稳定邻域搜索(SNS)方法在一致性和成本方面表现如何?

主要发现

  • 标准反事实生成方法在模型因微小训练变化而改变时表现出较低的一致性,例如在德国信贷数据集上,反事实被无效化的比例高达78%。
  • 在深度模型中,仅增加反事实成本不足以确保一致性,因为高成本示例仍频繁无法在相似模型间泛化。
  • 位于局部Lipschitz常数较低且模型置信度较高的区域的反事实表现出显著更高的稳定性,当使用SNS时,所有数据集上的无效化率降至0.00±0.00。
  • 与基线方法相比,SNS将反事实成本降低了最多50%,同时实现接近零的无效化率,例如在台湾信贷数据集上,ℓ₂成本为2.78±0.49,而Pawelczyk等人方法为4.24±2.23。
  • 当应用于min-ℓ₁、min-ℓ₂和基于PGD的基线时,SNS在所有数据集和重新训练场景中均实现了近乎完美的稳定性(无效化率为0.00±0.00)。
  • 理论分析证实,较小的Lipschitz常数和较高的置信度可限制模型微调下决策边界的变动,从而解释了SNS的实证成功。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。