Skip to main content
QUICK REVIEW

[论文解读] Shapley explainability on the data manifold

Christopher Frye, Damien de Mijolla|arXiv (Cornell University)|Jun 1, 2020
Explainable Artificial Intelligence (XAI)参考文献 43被引用 12
一句话总结

本文提出了两种在数据流形上计算Shapley值的方法,以克服AI可解释性中离流形解释的局限性。第一种方法使用生成建模,基于输入子集条件性地填补特征;第二种方法则通过监督回归直接学习Shapley值函数。两种方法均比离流形基线方法产生更准确、更稳定且更具可解释性的结果,尤其在MNIST和药物使用等高维数据集中表现更优。

ABSTRACT

Explainability in AI is crucial for model development, compliance with regulation, and providing operational nuance to predictions. The Shapley framework for explainability attributes a model's predictions to its input features in a mathematically principled and model-agnostic way. However, general implementations of Shapley explainability make an untenable assumption: that the model's features are uncorrelated. In this work, we demonstrate unambiguous drawbacks of this assumption and develop two solutions to Shapley explainability that respect the data manifold. One solution, based on generative modelling, provides flexible access to data imputations; the other directly learns the Shapley value-function, providing performance and stability at the cost of flexibility. While "off-manifold" Shapley values can (i) give rise to incorrect explanations, (ii) hide implicit model dependence on sensitive attributes, and (iii) lead to unintelligible explanations in higher-dimensional data, on-manifold explainability overcomes these problems.

研究动机与目标

  • 识别并展示离流形Shapley值的关键缺陷,其假设特征独立性,导致生成不真实的特征拼接数据。
  • 解决由于离流形插补导致的错误、不稳定且难以理解的解释问题,特别是在模型无关的可解释性中。
  • 开发两种可扩展、通用的Shapley值计算方法,尊重底层数据流形的结构。
  • 表明流形内解释比离流形方法更准确、更稳定且语义上更合理,尤其在高维数据中表现更优。
  • 提供一种实用、高效且模型无关的Shapley可解释性解决方案,避免不真实的特征拼接。

提出的方法

  • 提出流形内值函数 $ v^{\text{(on)}}_{f_y(x)}(S) = \mathbb{E}_{p(x'\mid x_S)}[f_y(x')] $,通过将非联盟中的特征条件化于联盟中的特征,确保数据一致性。
  • 引入生成建模方法以估计 $ p(x'\mid x_S) $,实现灵活、模型无关的流形上缺失特征插补。
  • 开发一种监督学习方法,直接使用神经网络对Shapley值函数进行回归,最小化值函数的均方误差(MSE)。
  • 利用从学习到的条件分布 $ \hat{p}(x'\mid x_S) $ 中进行蒙特卡洛采样,高效计算流形内Shapley值。
  • 采用可微分架构端到端训练监督模型,实现对解释保真度的直接优化。
  • 在MNIST和药物使用数据集上验证两种方法,与离流形基线方法及经验真实值进行性能比较。

实验结果

研究问题

  • RQ1离流形Shapley值在解释正确性、对敏感属性的敏感性以及高维数据中的可解释性方面存在哪些具体缺陷?
  • RQ2是否可以在不假设特征独立性的前提下,高效且准确地在一般高维数据集上计算流形内Shapley值?
  • RQ3在流形内可解释性方面,生成建模与直接值函数学习在准确性、稳定性和计算效率方面如何比较?
  • RQ4流形内解释在多大程度上提升了可解释性并减少了虚假归因,相较于离流形方法?
  • RQ5流形内Shapley值能否有效揭示或隐藏模型对敏感特征的隐式依赖?与离流形方法相比表现如何?

主要发现

  • 离流形Shapley值因生成不真实的特征拼接数据而产生错误的解释,尤其在高维数据(如MNIST)中更为明显。
  • 离流形方法可能隐藏模型对敏感属性的隐式依赖,从而损害受监管AI系统中的公平性与合规性。
  • 流形内解释更具集中性且更易解释,在MNIST数字中能清晰突出手写笔画等关键特征。
  • 监督方法在测试集上的MSE显著低于离流形拼接方法(如药物使用数据集上为0.0121 ± 0.0001 vs. 0.0448 ± 0.0005),表明其准确性更高。
  • 监督方法更稳定且高效,达到相同标准误差所需模型评估次数约为无监督生成方法的十分之一。
  • 流形内解释仅需极少特征(像素)即可实现可靠的归因,与低维数据流形一致;而离流形方法则依赖于庞大的联盟。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。