[论文解读] Generative causal explanations of black-box classifiers
本文提出了一种用于黑箱分类器的生成式因果解释框架,通过学习解耦的、低维的潜在表征,生成全局和局部的因果解释。通过优化一个联合目标函数,平衡数据保真度与因果影响(利用互信息衡量),该方法生成了真实、符合数据分布的反事实样本,揭示了哪些潜在因素会因果性地影响分类器决策,在可解释性和有效性方面优于显著性图。
We develop a method for generating causal post-hoc explanations of black-box classifiers based on a learned low-dimensional representation of the data. The explanation is causal in the sense that changing learned latent factors produces a change in the classifier output statistics. To construct these explanations, we design a learning framework that leverages a generative model and information-theoretic measures of causal influence. Our objective function encourages both the generative model to faithfully represent the data distribution and the latent factors to have a large causal influence on the classifier output. Our method learns both global and local explanations, is compatible with any classifier that admits class probabilities and a gradient, and does not require labeled attributes or knowledge of causal structure. Using carefully controlled test cases, we provide intuition that illuminates the function of our objective. We then demonstrate the practical utility of our method on image recognition tasks.
研究动机与目标
- 开发一种事后解释方法,为黑箱分类器提供因果性、反事实性的解释,而无需依赖标注属性或已知的因果结构。
- 通过确保反事实样本保持在数据分布内,避免不切实际或不合理的扰动,解决生成有意义反事实样本的挑战。
- 通过单一生成模型学习解耦的潜在因子并量化其对分类器输出的可测量因果影响,统一实现全局与局部解释能力。
- 在结构因果模型框架下,使用信息论度量(特别是潜在因子与分类器输出之间的互信息)形式化因果影响。
- 通过生成反映潜在因子因果变化的真实图像样本,在视觉任务中实现实用且可解释的解释。
提出的方法
- 该方法采用变分自编码器(VAE)学习输入数据的解耦、低维潜在表征,从而实现对数据特定方面的控制。
- 采用联合优化目标,平衡数据保真度(重建质量)与因果影响,后者通过潜在因子 $\alpha$ 与分类器输出 $Y$ 之间的互信息 $I(\alpha; Y)$ 衡量。
- 该框架使用结构因果模型(SCM)形式化因果关系,确保当潜在因子具有因果相关性时,其变化会直接影响分类器输出。
- 生成模型将学习到的潜在空间映射回数据空间,从而合成反映因果变化的真实反事实样本。
- 该方法兼容任何提供类别概率和梯度的分类器,支持端到端训练与解释生成。
- 通过超参数 $\lambda$ 对优化过程进行正则化,以平衡潜在空间中忠实的数据重建与强因果影响之间的权衡。
实验结果
研究问题
- RQ1能否训练一个生成模型,使其生成的反事实解释既真实又具有因果意义,而无需依赖标注属性或已知的因果结构?
- RQ2在黑箱设置下,如何严格量化并优化潜在因子对分类器输出的因果影响?
- RQ3与显著性图或特征归因方法相比,解耦的潜在表征在多大程度上能提升事后解释的可解释性和表达力?
- RQ4模型容量(例如VAE中每层的滤波器数量)与同时实现高数据保真度和强因果影响的能力之间存在何种关系?
- RQ5该方法能否使用同一框架同时生成全局解释(通过在数据流形上操纵因子)和局部解释(针对单个预测)?
主要发现
- 该方法成功学习了解耦的潜在因子,当特定因子(如颜色)发生变化时,分类器输出产生可测量且一致的变化,而其他因子(如形状)的变化则无影响,证明了因果控制的有效性。
- 在足够大的模型容量下(例如每层64个滤波器),生成样本与训练数据高度相似,且因果因子与分类器相关方面一致,如定性结果所示。
- 对于三分类的Fashion-MNIST分类器,互信息值 $I(\alpha; Y) = 1.03$ nats 意味着预测误差的上界为 $\pi(Y|\alpha) \leq 0.05$,表明因果因子至少解释了黑箱分类器95%的行为。
- 模型容量不足(例如每层8个滤波器)导致数据重建质量差,且潜在因子与分类器行为之间对应关系微弱,凸显了容量对有效解释的重要性。
- 该框架在可解释性方面优于显著性图,因为它生成了真实、语义有意义的反事实样本,而非稀疏、噪声的归因图。
- 该方法支持全局与局部解释:全局解释通过在潜在空间中逐因子操纵实现,局部解释则通过对应于单个输入的潜在码实现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。