Skip to main content
QUICK REVIEW

[论文解读] Explanation by Progressive Exaggeration

Sumedha Singla, Brian P. Pollack|arXiv (Cornell University)|Nov 1, 2019
Explainable Artificial Intelligence (XAI)参考文献 42被引用 13
一句话总结

该论文提出了一种模型无关的方法,通过逐步生成真实、自然的输入图像扰动,系统性地将黑箱分类器的预测从原始类别转移到其否定类别,从而解释其决策。通过利用梯度信息和条件生成模型,该方法在决策边界上生成可调节的渐进式解释路径,使用户能够高保真地探索特征重要性、检测偏差并验证模型行为,适用于医学影像和基准任务。

ABSTRACT

As machine learning methods see greater adoption and implementation in high stakes applications such as medical image diagnosis, the need for model interpretability and explanation has become more critical. Classical approaches that assess feature importance (e.g. saliency maps) do not explain how and why a particular region of an image is relevant to the prediction. We propose a method that explains the outcome of a classification black-box by gradually exaggerating the semantic effect of a given class. Given a query input to a classifier, our method produces a progressive set of plausible variations of that query, which gradually changes the posterior probability from its original class to its negation. These counter-factually generated samples preserve features unrelated to the classification decision, such that a user can employ our method as a "tuning knob" to traverse a data manifold while crossing the decision boundary. Our method is model agnostic and only requires the output value and gradient of the predictor with respect to its input.

研究动机与目标

  • 为高风险应用(如医学影像诊断)中黑箱模型决策缺乏直观、渐进且真实的解释问题提供解决方案。
  • 开发一种方法,不仅解释模型预测的‘哪些特征重要’,更解释‘为何’做出该预测,通过生成合理的反事实变体。
  • 使用户能够将决策边界作为‘调节旋钮’进行交互式探索,以理解模型行为并检测隐藏偏差。
  • 确保解释在语义上具有意义且忠实于数据流形,避免不真实或不可能的扰动。
  • 通过比较有偏和无偏分类器的解释,提供一种检测训练模型中偏差的工具。

提出的方法

  • 该方法使用一个条件生成器 $ G_f^\delta $,其输入为查询图像 $ \mathbf{x} $ 和期望的输出偏移量 $ \delta $,输出为使分类器输出概率发生 $ \delta $ 变化的扰动图像 $ \mathbf{x}_\delta $。
  • 生成器采用类似GAN的框架进行训练,其中判别器 $ D $ 的作用是确保生成的扰动在视觉上真实可信,同时保持身份和语义一致性。
  • 该方法依赖于黑箱模型的输出 $ f(\mathbf{x}) $ 及其梯度 $ \nabla_\mathbf{x}f(\mathbf{x}) $,因此具有模型无关性,可适用于任何可微分分类器。
  • 通过一个潜在空间编码器 $ E $ 将输入图像映射到潜在嵌入空间,使生成器能够学习解耦的、语义上有意义的扰动。
  • 通过迭代应用小幅度的 $ \delta $-偏移,实现渐进式夸张,生成一系列图像,逐步将预测从正类转变为负类。
  • 通过优化生成器,使其生成的样本在判别器指导下具备真实性,同时在梯度引导下忠实于模型的决策边界,从而确保生成结果的合理性。

实验结果

研究问题

  • RQ1是否存在一种模型无关的方法,能够生成真实、渐进的扰动,系统性地将黑箱分类器的输出从一个类别转移到其否定类别?
  • RQ2生成的反事实图像在穿越决策边界时是否保持了身份和语义一致性?
  • RQ3用户是否能够可靠地通过观察生成图像的渐进变化,识别出被夸张的目标特征或类别?
  • RQ4该方法能否有效检测并暴露分类器决策过程中隐藏的偏差,尤其是在与公平参考模型对比时?
  • RQ5与显著性图相比,该方法在解释复杂、分布式的特征(如医学影像中的疾病模式)方面是否更有效?

主要发现

  • 在平均77%的案例中,人工评估者正确识别了目标类别,其中‘微笑’的准确率高达99%,‘胡须’为87%,而‘齐刘海’最困难,准确率为50%。
  • 在相对排序任务中,标注者总体准确率达到83.5%,且组内一致性较高(kappa = 0.41),表明对渐进变化的感知具有可靠性。
  • 在偏差检测方面,93.75%的标注者正确识别出有偏分类器解释中的偏差存在,其中12.5%的标注者同时检测到‘微笑’和‘性别’的变化,揭示了细微但可检测的伪影。
  • 该方法在基准数据集(如CelebA)和真实医学影像数据上均成功生成了高质量、逼真的反事实样本,保持了身份和语义连贯性。
  • 该方法能够揭示分类器中的混淆偏差,例如在面部属性预测中检测到性别偏差,表现为有偏模型在面部区域出现不自然、大范围的异常变化。
  • 与显著性图相比,该方法在可解释性方面表现更优,因为它展示了特征如何渐进式变化,而不仅仅是静态地突出重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。