Skip to main content
QUICK REVIEW

[论文解读] Comparing Baseline Shapley and Integrated Gradients for Local Explanation: Some Additional Insights

Tianshu Feng, Zhipu Zhou|arXiv (Cornell University)|Aug 12, 2022
Explainable Artificial Intelligence (XAI)被引用 5
一句话总结

本文比较了基线Shapley与积分梯度在表格数据局部模型解释中的表现,分析了它们的理论与实证行为。结果表明,尽管在特定条件下(如线性模型或对称特征交互)两者表现一致,但在非线性设置下,尤其是使用ReLU激活的神经网络时,两者出现显著差异,其中基线Shapley由于其公理化基础,在归因上表现出更高的稳定性。

ABSTRACT

There are many different methods in the literature for local explanation of machine learning results. However, the methods differ in their approaches and often do not provide same explanations. In this paper, we consider two recent methods: Integrated Gradients (Sundararajan, Taly, & Yan, 2017) and Baseline Shapley (Sundararajan and Najmi, 2020). The original authors have already studied the axiomatic properties of the two methods and provided some comparisons. Our work provides some additional insights on their comparative behavior for tabular data. We discuss common situations where the two provide identical explanations and where they differ. We also use simulation studies to examine the differences when neural networks with ReLU activation function is used to fit the models.

研究动机与目标

  • 分析并比较基线Shapley与积分梯度在表格机器学习模型局部解释中的行为。
  • 识别两种方法产生相同或不同归因的理论与实证条件。
  • 评估两种方法在具有ReLU激活的深度神经网络中应用时的性能与一致性。
  • 在先前公理化比较的基础上提供额外见解,重点关注实际应用中对真实世界模型解释的影响。

提出的方法

  • 作者分析了基线Shapley与积分梯度的数学公式,重点关注其底层公理与基于路径的积分方法。
  • 推导出两种方法产生相同显著性分数的条件,特别是在线性模型和对称特征交互场景下。
  • 研究使用前馈神经网络与ReLU激活函数在合成表格数据集上进行模拟实验。
  • 对多个输入样本计算并比较显著性归因,以评估其一致性与差异性。
  • 分析结合了理论推导与使用受控模型架构的实证验证。
  • 比较基于两种方法的公理性质,特别是效率与对称性。

实验结果

研究问题

  • RQ1在何种条件下,基线Shapley与积分梯度对表格数据产生相同的局部归因?
  • RQ2当应用于具有ReLU激活的非线性模型时,两种方法在归因模式上如何不同?
  • RQ3基线Shapley的公理性质在复杂模型中在多大程度上提升了可解释性,优于积分梯度?
  • RQ4神经网络中是否存在系统性结构或架构因素,使一种解释方法优于另一种?

主要发现

  • 当模型为线性或特征交互对称且基线为中性时,基线Shapley与积分梯度产生相同的归因。
  • 在具有ReLU激活的神经网络的非线性设置中,两种方法在归因模式上显著分化,尤其在高非线性特征上更为明显。
  • 基线Shapley始终满足效率公理,确保归因总和等于模型输出与基线之间的差值,而积分梯度在某些路径选择下可能违反此性质。
  • 模拟研究显示,当从基线到输入的路径不能代表数据分布时,积分梯度可能产生不稳定的归因。
  • 基线Shapley在非线性模型中对输入扰动和路径选择表现出更强的鲁棒性,尤其在高维表格数据中。
  • 两种方法的差异在高度非线性或与其他特征强交互的特征上最为显著,表明积分梯度在这些情况下可能错误归因重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。