Skip to main content
QUICK REVIEW

[论文解读] Benchmarking Instance-Centric Counterfactual Algorithms for XAI: From White Box to Black Box

Catarina Moreira, Yu-Liang Chou|arXiv (Cornell University)|Mar 4, 2022
Explainable Artificial Intelligence (XAI)参考文献 79被引用 4
一句话总结

该论文在五个数据集上对四种模型无关的反事实生成算法——DiCE、WatcherCF、prototype 和 GrowingSpheresCF——在白盒(决策树)、灰盒(随机森林)和黑盒(神经网络)模型上进行了基准测试。研究发现,模型类型对反事实质量无显著影响;仅使用接近度损失函数的算法会产生不切实际的解释;而可解释性对于可靠评估至关重要,其中 DiCE 在定量性能与定性可解释性之间取得了最佳平衡。

ABSTRACT

This study investigates the impact of machine learning models on the generation of counterfactual explanations by conducting a benchmark evaluation over three different types of models: a decision tree (fully transparent, interpretable, white-box model), a random forest (semi-interpretable, grey-box model), and a neural network (fully opaque, black-box model). We tested the counterfactual generation process using four algorithms (DiCE, WatcherCF, prototype, and GrowingSpheresCF) in the literature in 25 different datasets. Our findings indicate that: (1) Different machine learning models have little impact on the generation of counterfactual explanations; (2) Counterfactual algorithms based uniquely on proximity loss functions are not actionable and will not provide meaningful explanations; (3) One cannot have meaningful evaluation results without guaranteeing plausibility in the counterfactual generation. Algorithms that do not consider plausibility in their internal mechanisms will lead to biased and unreliable conclusions if evaluated with the current state-of-the-art metrics; (4) A counterfactual inspection analysis is strongly recommended to ensure a robust examination of counterfactual explanations and the potential identification of biases.

研究动机与目标

  • 评估不同机器学习模型(白盒(决策树)、灰盒(随机森林)和黑盒(神经网络))对反事实解释生成的影响。
  • 使用标准化的定量指标评估四种最先进的反事实算法(DiCE、WatcherCF、prototype、GrowingSpheresCF)的性能。
  • 调查当前评估指标(如接近度和稀疏性)在不考虑可解释性的情况下,是否足以评估反事实质量。
  • 展示定性分析(包括决策路径检查)的必要性,以检测被定量指标遗漏的不切实际或有偏见的反事实。
  • 倡导在XAI研究中建立一个整合定量指标与定性可解释性检查的标准化、稳健的评估框架。

提出的方法

  • 在五个数据集(COMPAS、Adult、German、Diabetes 和 Breast Cancer)上开展基准评估。
  • 在三种模型类型上应用四种反事实生成算法:决策树(白盒)、随机森林(灰盒)和神经网络(黑盒)。
  • 使用标准定量指标:接近度(L2距离)、稀疏性(L0范数)和保真度来评估反事实。
  • 通过追踪底层模型中的决策路径,执行定性分析以评估可解释性与领域知识的一致性。
  • 生成反事实示例并进行可视化,以识别不切实际的改变(例如,年龄从34岁增加到81岁),揭示基于优化方法的缺陷。
  • 提供一个公开的基准代码库,以支持决策路径和反事实的可重现性,确保透明度。

实验结果

研究问题

  • RQ1选择机器学习模型(白盒、灰盒、黑盒)是否显著影响生成的反事实解释质量?
  • RQ2标准定量指标(如接近度和稀疏性)在多大程度上能预测反事实解释的质量?
  • RQ3当反事实算法的内部机制未强制实施可解释性约束时,其表现如何?
  • RQ4对决策路径的定性检查能否揭示定量指标所遗漏的偏见或不切实际之处?
  • RQ5在XAI反事实研究中,是否需要一个整合定量指标与定性可解释性检查的标准化评估框架?

主要发现

  • 底层机器学习模型的类型——无论是白盒(决策树)、灰盒(随机森林)还是黑盒(神经网络)——对反事实解释的生成质量无显著影响。
  • 仅依赖接近度损失函数的反事实算法(如 WatcherCF)产生了高度不切实际的反事实,包括极端变化,例如将年龄从34岁增加到81岁,将BMI从34增加到67。
  • GrowingSpheresCF 由于其对L0和L2范数的优化,在接近度和稀疏性方面取得了最佳定量指标,但未能确保可解释性,导致生成的解释存在偏见且无意义。
  • DiCE 通过其对不可变特征的处理,在定量结果与高可解释性之间实现了最佳平衡,从而取得了整体最佳表现。
  • WatcherCF 表现最差,因其优化仅基于与输入点的距离,导致反事实与真实决策路径显著偏离,即使在遵循决策树的第一个分裂节点时也是如此。
  • 本研究结论认为,若不结合可解释性检查,当前的评估指标是不充分的;对决策路径的定性分析对于检测偏见并确保可信的反事实解释至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。