Skip to main content
QUICK REVIEW

[论文解读] Using Shapley Values and Variational Autoencoders to Explain Predictive Models with Dependent Mixed Features

Lars Henry Berge Olsen, Ingrid K. Glad|arXiv (Cornell University)|Nov 26, 2021
Explainable Artificial Intelligence (XAI)被引用 5
一句话总结

该论文提出了一种新颖的方法,利用带有任意条件的变分自编码器(VAEAC)来建模混合型、连续型和类别型特征之间的复杂依赖关系,从而在可解释机器学习中实现精确的Shapley值估计。通过利用VAEAC捕捉高维特征依赖关系,该方法在低维和高维设置下均显著优于当前最先进方法,尤其在高维空间中采用非均匀掩码时表现更优。

ABSTRACT

Shapley values are today extensively used as a model-agnostic explanation framework to explain complex predictive machine learning models. Shapley values have desirable theoretical properties and a sound mathematical foundation in the field of cooperative game theory. Precise Shapley value estimates for dependent data rely on accurate modeling of the dependencies between all feature combinations. In this paper, we use a variational autoencoder with arbitrary conditioning (VAEAC) to model all feature dependencies simultaneously. We demonstrate through comprehensive simulation studies that our VAEAC approach to Shapley value estimation outperforms the state-of-the-art methods for a wide range of settings for both continuous and mixed dependent features. For high-dimensional settings, our VAEAC approach with a non-uniform masking scheme significantly outperforms competing methods. Finally, we apply our VAEAC approach to estimate Shapley value explanations for the Abalone data set from the UCI Machine Learning Repository.

研究动机与目标

  • 解决在高风险应用场景中,对具有依赖关系的混合类型特征(连续型和类别型)的预测模型进行解释的关键挑战。
  • 克服现有Shapley值估计方法在假设特征独立或使用简单依赖模型方面的局限性。
  • 开发一种可扩展的、可微分的框架,能够对复杂、高维的特征依赖关系进行建模,以实现精确的局部模型解释。
  • 提升在现实场景中Shapley值解释的准确性和可靠性,这些场景中特征依赖关系普遍存在,但标准方法往往忽略。
  • 在多种模拟设置和一个真实世界的鲍鱼数据集上,证明该方法的鲁棒性和优越性。

提出的方法

  • 提出一种带有任意条件的变分自编码器(VAEAC),用于建模所有特征组合的联合分布,捕捉混合型数据中的复杂依赖关系。
  • 利用VAEAC潜在空间中的蒙特卡洛采样,估计Shapley值计算所需的条件概率,从而高效近似高维积分。
  • 在高维设置中引入非均匀掩码策略,通过聚焦于信息量更高的特征子集,提高估计效率和准确性。
  • 将VAEAC条件化于特定特征值,为每个Shapley值项生成现实的反事实特征组合,确保对数据依赖关系的真实表示。
  • 利用VAEAC的生成能力,同时对连续型和类别型特征进行建模,避免使用独立的建模流程。
  • 使用变分下界目标函数训练VAEAC,实现端到端优化,以实现精确的条件密度估计。

实验结果

研究问题

  • RQ1当特征具有依赖关系且类型混合时,如何准确估计Shapley值?
  • RQ2在特征依赖条件下,像VAEAC这样的深度生成模型是否能优于传统统计依赖模型(如图 copulas、vine copulas)进行Shapley值估计?
  • RQ3非均匀掩码策略对高维特征空间中Shapley值估计准确性有何影响?
  • RQ4在多种模拟设置下,基于VAEAC的方法在平均绝对误差和计算效率方面与当前最先进方法相比如何?
  • RQ5VAEAC框架能否为具有复杂特征依赖关系的真实世界数据集(如鲍鱼数据集)提供可靠且可解释的解释?

主要发现

  • 在包含依赖关系的连续型和混合型特征的多种模拟设置下,VAEAC方法在Shapley值估计的平均绝对误差方面显著优于当前最先进方法。
  • 在高维设置中(M=10),采用非均匀掩码的VAEAC比均匀掩码和竞争方法更有效地降低估计误差,展现出更优的可扩展性。
  • 在使用K=250次蒙特卡洛采样时,该方法实现了稳定且精确的Shapley值估计,在精度和计算成本之间达到良好平衡。
  • VAEAC模型有效捕捉了混合型数据中的复杂非线性依赖关系,其能够建模与训练数据结构一致的条件分布,证明了这一点。
  • 在鲍鱼数据集上,基于VAEAC的解释框架相比基于独立性假设或更简单依赖模型的方法,提供了更可靠且一致的特征重要性排序。
  • VAEAC框架对不同强度的特征依赖关系具有鲁棒性,并且在强相关结构下仍能保持高估计算准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。