[论文解读] Towards Ground Truth Explainability on Tabular Data
本文提出一种基于配管(copulas)和符号表达式的合成表格数据生成方法,以在XAI中实现真实可解释性。通过控制特征相关性和函数依赖关系,该方法提供可验证的局部与全局解释,表明由信息性特征引起的相关性会因数据分布偏差而非模型学习导致SHAP值失真。
In data science, there is a long history of using synthetic data for method development, feature selection and feature engineering. Our current interest in synthetic data comes from recent work in explainability. Today's datasets are typically larger and more complex - requiring less interpretable models. In the setting of extit{post hoc} explainability, there is no ground truth for explanations. Inspired by recent work in explaining image classifiers that does provide ground truth, we propose a similar solution for tabular data. Using copulas, a concise specification of the desired statistical properties of a dataset, users can build intuition around explainability using controlled data sets and experimentation. The current capabilities are demonstrated on three use cases: one dimensional logistic regression, impact of correlation from informative features, impact of correlation from redundant variables.
研究动机与目标
- 解决表格数据后处理模型可解释性中缺乏真实标签的问题。
- 实现对特征相关性如何影响局部与全局解释的受控实验。
- 提供一个灵活且可复现的框架,用于生成具有已知函数依赖关系和统计特性的合成数据集。
- 研究信息性特征与冗余特征的相关性对基于SHAP的归因影响。
- 通过合成数据弥合符号化全局解释与模型无关的局部解释之间的差距。
提出的方法
- 该方法使用配管来定义输入特征的边缘分布和相关结构,从而精确控制统计特性。
- 符号表达式定义了特征与目标标签之间的真正函数关系,确保全局可解释性。
- 基于从符号表达式推导出的概率场应用阈值,分配二元分类标签。
- 该方法生成具有已知真实特征重要性的数据集,从而可验证如SHAP等局部解释方法。
- 生成相同数据的关联与非关联版本,以隔离输入相关性对解释输出的影响。
- 使用SHAP DeepExplainer计算局部归因,并通过跨数据集比较评估解释保真度。
实验结果
研究问题
- RQ1信息性特征之间的相关性如何影响SHAP值等局部模型解释的可靠性?
- RQ2冗余特征(相关但不重要)的存在是否会以模仿特征重要性的方式扭曲局部归因?
- RQ3具有已知函数依赖关系的合成数据能否作为评估表格数据XAI方法的真实基准?
- RQ4观察到的SHAP值失真在多大程度上是数据分布偏差所致,而非模型学习的结果?
- RQ5如何将符号表达式与配管结合,以生成具有可验证解释的复杂、真实感合成表格数据?
主要发现
- 信息性特征之间的相关性导致SHAP值发生失真,其值向第一象限和第三象限偏移,这是由于关联数据分布中的类别不平衡所致。
- SHAP值受相关性影响的表观效应是关联数据期望值的产物,而非模型学习到的偏差,这一点通过在非关联基线数据上重新拟合解释器得到验证。
- 冗余特征(尽管未包含在符号表达式中)显著改变了SHAP归因,其个体贡献无法加总为基线解释。
- 将冗余特征、信息性特征和干扰特征的SHAP值相加,无法恢复原始全局解释,表明解释方法对特征空间构成高度敏感。
- 符号表达式提供了可验证的全局解释,而SHAP值在关联数据上显示出系统性偏差,凸显了对局部解释进行谨慎解读的必要性。
- 该方法成功生成了真实特征重要性已知的合成数据集,从而实现了对表格数据XAI技术的受控评估。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。