Skip to main content
QUICK REVIEW

[论文解读] High Dimensional Model Explanations: an Axiomatic Approach

Neel Patel, Martin Strobel|arXiv (Cornell University)|Jun 16, 2020
Explainable Artificial Intelligence (XAI)参考文献 43被引用 5
一句话总结

本文提出了一套新颖的高维模型解释的公理化框架,利用Banzhaf交互指数(BII)捕捉高阶特征交互。通过形式化对称性、单调性与效率等理想性质,作者证明BII是满足这些公理的唯一解释方法,并表明其对应于黑箱模型的最优k次多项式逼近,在捕捉协同效应方面优于逐特征分析方法。

ABSTRACT

Complex black-box machine learning models are regularly used in critical decision-making domains. This has given rise to several calls for algorithmic explainability. Many explanation algorithms proposed in literature assign importance to each feature individually. However, such explanations fail to capture the joint effects of sets of features. Indeed, few works so far formally analyze high-dimensional model explanations. In this paper, we propose a novel high dimension model explanation method that captures the joint effect of feature subsets. We propose a new axiomatization for a generalization of the Banzhaf index; our method can also be thought of as an approximation of a black-box model by a higher-order polynomial. In other words, this work justifies the use of the generalized Banzhaf index as a model explanation by showing that it uniquely satisfies a set of natural desiderata and that it is the optimal local approximation of a black-box model. Our empirical evaluation of our measure highlights how it manages to capture desirable behavior, whereas other measures that do not satisfy our axioms behave in an unpredictable manner.

研究动机与目标

  • 解决现有逐特征分析方法在复杂机器学习模型中无法捕捉高阶特征交互的局限性。
  • 在机器学习背景下,形式化一组自然且理想的高维模型解释公理。
  • 证明Banzhaf交互指数(BII)是满足这些公理的唯一解释方法。
  • 建立BII与黑箱模型最优多项式逼近之间的联系,提供几何与优化基础的解释。
  • 通过实证方法证明BII能捕捉标准方法失效时的有意义特征交互。

提出的方法

  • 使用四个核心公理对高维解释方法进行公理化:对称性、极限条件、一般-2-效率性,以及新提出的单调性公理。
  • 将Banzhaf交互指数(BII)定义为满足这些公理的唯一解,确保特征交互效应的忠实表示。
  • 将黑箱模型f(·)逼近为k次多项式g_k(·)的问题形式化,使所有2^N个输入组合上的全局二次损失最小化。
  • 证明最优k次多项式逼近中,单项式∏_{i∈S} x_i的系数等于特征集S的BII值(定理2)。
  • 将最小二乘多项式逼近用作BII的几何与统计基础,将其与统计学和博弈论中的标准交互概念联系起来。
  • 将传统基于特征的解释(即局部线性逼近)扩展为能捕捉交互效应的高阶多项式逼近。

实验结果

研究问题

  • RQ1哪组公理能唯一刻画一种忠实捕捉特征交互的高维模型解释方法?
  • RQ2如何正式证明Banzhaf交互指数可作为机器学习中的模型解释方法?
  • RQ3是否存在一个自然的优化问题,其解即为Banzhaf交互指数?
  • RQ4BII-based解释方法在捕捉真实模型中协同效应方面,与标准逐特征分析方法相比如何?
  • RQ5违反关键公理(如单调性)会对解释方法产生何种后果?

主要发现

  • Banzhaf交互指数(BII)是满足所提公理集(包括新提出的单调性条件)的唯一解释方法。
  • BII恰好对应于黑箱模型最小二乘多项式逼近中k次单项式的系数,提供了几何与优化基础的解释。
  • 实证评估表明,标准逐特征分析方法无法捕捉协同效应,例如在文本评论中'not'与'bad'共同出现时产生的正面情感。
  • 违反单调性公理的解释方法表现出不可预测且反直觉的行为,例如单独为'bad'和'not'分配高负影响,尽管其联合效应为正。
  • 基于BII的方法通过捕捉特征子集的真实联合影响,提供了更可靠且可解释的解释,尤其在强交互效应情况下表现更优。
  • 理论分析确认,当使用k次多项式逼近黑箱模型时,BII在最小化全局二次误差的意义上是最优的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。