[论文解读] Accurate Shapley Values for explaining tree-based models
本文提出了两种新的估计器——Discrete 和 Leaf——用于在基于树的模型中计算 Shapley Values (SV),其准确性优于当前最先进的方法(如 TreeSHAP),尤其是在特征依赖和类别变量情况下。它表明,当特征存在依赖关系时,标准 SV 估计存在偏差,且基于编码的类别变量 SV 聚合会导致错误解释,为此提出了一种基于联盟的 SV 计算方法,具有理论上的严谨性。
Shapley Values (SV) are widely used in explainable AI, but their estimation and interpretation can be challenging, leading to inaccurate inferences and explanations. As a starting point, we remind an invariance principle for SV and derive the correct approach for computing the SV of categorical variables that are particularly sensitive to the encoding used. In the case of tree-based models, we introduce two estimators of Shapley Values that exploit the tree structure efficiently and are more accurate than state-of-the-art methods. Simulations and comparisons are performed with state-of-the-art algorithms and show the practical gain of our approach. Finally, we discuss the limitations of Shapley Values as a local explanation. These methods are available as a Python package.
研究动机与目标
- 解决现有基于树的模型中 Shapley Value (SV) 估计器在特征依赖情况下的不准确性问题。
- 解决因标准编码方式导致类别变量 SV 解释错误的问题。
- 提供一种理论基础坚实的 SV 计算方法,确保在变量重参数化下的不变性。
- 通过纠正 SV 的全局性质对局部可解释性造成的影响,提升局部解释的可靠性。
提出的方法
- 推导了 SV 在重参数化下的不变性原理,确保无论变量编码方式如何,解释结果保持一致。
- 提出基于联盟的 SV 定义(公式 2),将经典 SV 扩展至变量组,特别适用于类别特征。
- 提出 Discrete 估计器,直接在离散化的类别变量上计算 SV,避免编码引起的偏差。
- 开发 Leaf 估计器,通过在每个叶节点上对所有训练数据点进行聚合,构建简化预测器,实现准确的 SV 估计。
- 基于真实数据分布下的条件期望定义简化预测器,提升估计精度。
- 在 Python 包中实现所提出的估计器,便于在 XAI 应用中实际使用。
实验结果
研究问题
- RQ1特征依赖如何影响基于树的模型中 Shapley Value 估计的准确性?
- RQ2为何对类别变量的标准编码方式下对 SV 求和的做法存在问题?
- RQ3能否开发一种理论严谨的估计器,确保连续和类别特征在变量编码下的不变性?
- RQ4在特征依赖条件下,当前 SV 估计器(如 TreeSHAP)在多大程度上无法准确捕捉真实特征贡献?
- RQ5Shapley Values 真的是局部解释吗?还是它们保留了全局依赖关系,从而削弱了局部可解释性?
主要发现
- 在 p=5 的合成数据中,Discrete 估计器在相对绝对误差(R-AE)方面优于 TreeSHAP,尤其在特征依赖条件下表现更优。
- 随着特征相关性增加,Leaf 估计器的 R-AE 显著低于 TreeSHAP,当相关系数 ρ 达到 0.99 时性能提升最为明显。
- 当特征存在依赖关系时,TreeSHAP 显示出显著偏差,导致特征重要性估计不可靠。
- 对类别变量的编码变量 SV 求和,会导致所有特征的 SV 值错误,从而使解释无效。
- Shapley Values 并非真正意义上的局部解释,如命题 5.1 所示,由于在不同模型模式下的全局平均,非活跃特征的 SV 也可能非零。
- 所提出的估计器即使在高维(p=500)情况下也具备计算可行性,Leaf 估计器对维度增加表现出鲁棒性,尽管运行时间高于 TreeSHAP。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。