Skip to main content
QUICK REVIEW

[论文解读] Diffusion Visual Counterfactual Explanations

Maximilian Augustin, Valentyn Boreiko|arXiv (Cornell University)|Oct 21, 2022
Adversarial Robustness in Machine Learning被引用 15
一句话总结

本文提出扩散视觉反事实解释(DVCEs),一种利用扩散模型为任意ImageNet分类器生成逼真、最小化且语义有意义的反事实图像的方法。通过结合自适应重参数化、距离正则化以及通过对抗鲁棒模型实现的圆锥正则化,DVCEs生成视觉上接近原图、且具有高置信度的反事实样本,从而揭示模型偏差,且无需针对特定模型进行微调,也不受限于鲁棒模型。

ABSTRACT

Visual Counterfactual Explanations (VCEs) are an important tool to understand the decisions of an image classifier. They are 'small' but 'realistic' semantic changes of the image changing the classifier decision. Current approaches for the generation of VCEs are restricted to adversarially robust models and often contain non-realistic artefacts, or are limited to image classification problems with few classes. In this paper, we overcome this by generating Diffusion Visual Counterfactual Explanations (DVCEs) for arbitrary ImageNet classifiers via a diffusion process. Two modifications to the diffusion process are key for our DVCEs: first, an adaptive parameterization, whose hyperparameters generalize across images and models, together with distance regularization and late start of the diffusion process, allow us to generate images with minimal semantic changes to the original ones but different classification. Second, our cone regularization via an adversarially robust model ensures that the diffusion process does not converge to trivial non-semantic changes, but instead produces realistic images of the target class which achieve high confidence by the classifier.

研究动机与目标

  • 为标准图像分类器解决缺乏模型无关、逼真且语义有意义的反事实解释的问题。
  • 克服现有方法依赖对抗鲁棒模型、生成非真实感伪影或局限于少数类别数据集的局限性。
  • 开发一种通用方法,用于生成既扰动最小又语义连贯的视觉反事实(VCEs)。
  • 通过生成高置信度反事实样本,揭示分类器中的虚假特征,这些样本反映真实数据分布特性。

提出的方法

  • 利用由分类器和距离正则化引导的扩散过程,确保从原始图像出发的扰动最小且感知上微小。
  • 采用自适应重参数化方法对扩散过程进行调整,使用固定超参数适用于所有图像和模型,实现良好泛化。
  • 在扩散过程早期阶段延迟启动,以在生成初期保持原始图像的语义信息。
  • 利用对抗鲁棒模型实施圆锥正则化,引导扩散过程生成逼真且属于目标类别的图像,防止生成非语义或平凡的扰动。
  • 将分类器置信度作为关键信号,确保生成的反事实样本以高概率被正确分类为目标类别。
  • 在不为每个分类器微调生成模型的前提下生成反事实样本,从而实现对任意ImageNet分类器的广泛适用性。

实验结果

研究问题

  • RQ1扩散模型能否在无需模型特定微调的情况下,为任意ImageNet分类器生成逼真、最小化且语义有意义的视觉反事实?
  • RQ2如何修改扩散过程,以确保反事实样本在视觉上接近原始图像,同时实现对目标类别的高分类器置信度?
  • RQ3通过对抗鲁棒模型实施的圆锥正则化,在多大程度上可防止生成非语义或平凡的扰动?
  • RQ4与先前方法相比,DVCEs在揭示分类器学习到的虚假特征方面表现如何,尤其是在ImageNet等复杂数据集上?
  • RQ5所提出方法能否在不同架构(如ResNet、Swin、ConvNeXt)之间泛化,并检测到已知和新型的虚假特征?

主要发现

  • DVCEs成功为多种ImageNet分类器生成逼真、最小化且高置信度的反事实图像,包括非鲁棒模型。
  • 该方法揭示了已知的虚假特征,如在'tench'和'white shark'类别中出现的人类手部和笼子,与先前研究结果一致。
  • 发现了新的虚假特征,例如'bee'类别中花朵的出现会提高分类置信度,'tiger cat'类别中老虎面孔的出现也具有类似效应,表明模型依赖于非语义属性。
  • 用户研究表明,与基线方法(如$l_{1.5}$-SVCEs和BDVCEs)相比,DVCEs在感知上更具意义、更逼真且更微妙。
  • 该方法在不同模型间具有泛化能力,并在固定超参数下保持一致性能,展现出鲁棒性与可扩展性。
  • 失败案例包括因扩散模型伪影导致的模糊性,以及当原始类别与目标类别语义差异较大时难以生成合理改变。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。