[论文解读] Human-interpretable model explainability on high-dimensional data
本文提出了一种针对高维数据的人类可理解的可解释性框架,首先通过傅里叶变换、解耦表示或图像到图像的转换等方法,将原始输入映射到低维、语义上有意义的潜在空间,然后在该空间中应用Shapley值来解释模型预测。该方法在图像分类等复杂模型上实现了理论基础坚实、计算可行且用户可理解的解释。
The importance of explainability in machine learning continues to grow, as both neural-network architectures and the data they model become increasingly complex. Unique challenges arise when a model's input features become high dimensional: on one hand, principled model-agnostic approaches to explainability become too computationally expensive; on the other, more efficient explainability algorithms lack natural interpretations for general users. In this work, we introduce a framework for human-interpretable explainability on high-dimensional data, consisting of two modules. First, we apply a semantically meaningful latent representation, both to reduce the raw dimensionality of the data, and to ensure its human interpretability. These latent features can be learnt, e.g. explicitly as disentangled representations or implicitly through image-to-image translation, or they can be based on any computable quantities the user chooses. Second, we adapt the Shapley paradigm for model-agnostic explainability to operate on these latent features. This leads to interpretable model explanations that are both theoretically controlled and computationally tractable. We benchmark our approach on synthetic data and demonstrate its effectiveness on several image-classification tasks.
研究动机与目标
- 为解决在高维数据上实现计算可行且人类可理解的模型解释这一挑战。
- 克服现有模型无关可解释性方法的局限性,后者会产生不直观、高维的解释(例如,像素级显著性图)。
- 开发一种灵活且基于原理的方法,用语义上有意义的概念而非原始输入特征来解释模型预测。
- 将理论严谨的Shapley框架与用户定义的低维语义特征空间相结合,以提升可解释性。
- 在包含真实世界和合成数据的多样化图像分类基准上,展示该方法的有效性。
提出的方法
- 使用用户定义或学习到的表示方法(如傅里叶变换、解耦表示或图像到图像的转换),将高维原始输入转换为低维、语义上有意义的潜在空间。
- 采用模型无关的方法在潜在特征上计算Shapley值,确保理论一致性并捕捉特征之间的交互作用。
- 利用现有的预训练模型和现成组件(如VAE、GAN或扩散模型)提取语义特征,无需重新训练。
- 将Shapley框架应用于潜在空间,量化每个语义特征对模型预测的贡献。
- 使用具有已知真实特征的合成数据以及真实世界数据集(包括CelebA、MNIST、CIFAR-10、ImageNet和Describable Textures)验证该方法。
- 通过特征遍历和反事实评估,验证解释是否真实反映模型行为,而非解释方法本身带来的伪影。
实验结果
研究问题
- RQ1我们能否通过用语义上有意义的潜在特征替代原始输入特征,在高维数据上实现人类可理解的模型解释?
- RQ2在低维语义特征空间中应用Shapley框架,是否能在保持理论严谨性的同时提升计算可行性?
- RQ3不同语义特征学习或定义方法(如傅里叶变换、解耦、图像转换)如何影响解释的质量和可解释性?
- RQ4这些解释在多大程度上反映了模型的真实行为,特别是在涉及细微或难以察觉的特征时?
- RQ5该框架能否检测并解释模型偏差,例如在吸引力预测中与性别或年龄相关的偏差?
主要发现
- 该方法成功地以语义上有意义的特征(如性别、年龄、发色)解释了CelebA数据集中模型的预测,揭示了性别对吸引力预测具有显著影响。
- 模型表现出一种偏差:女性被标记为有吸引力的可能性超过男性的两倍,这一偏差在Shapley解释中得到了清晰体现。
- 即使感知变化极小的特征(如“年轻”属性)也被发现显著影响预测结果,这一点通过潜在空间遍历的模型评估得到了验证。
- 该方法在多种数据集(包括MNIST、CIFAR-10、ImageNet和Describable Textures)上表现出鲁棒性和可解释性,且使用了现成的模型。
- 基于潜在特征的解释比像素级显著性图更具可解释性,因为它们直接将预测与高层概念联系起来,而非低层模式。
- 该框架有效捕捉了非平凡的依赖关系,例如在男性样本中,“年轻”属性的局部Shapley值为负,表明在数据中青年与相反的预测结果相关。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。