Skip to main content
QUICK REVIEW

[论文解读] Imperceptible Adversarial Examples for Fake Image Detection

Quanyu Liao, Yuezun Li|arXiv (Cornell University)|Jun 3, 2021
Adversarial Robustness in Machine Learning参考文献 19被引用 4
一句话总结

本文提出了一种新型方法——关键区域攻击(Key Region Attack, KRA),通过仅针对多层特征图识别出的最关键像素进行扰动,生成对虚假图像检测器具有欺骗性的不可察觉对抗样本。通过同时最小化扰动的$L_0$和$L_2$范数,KRA在显著降低感知明显度的同时,实现了当前最先进的攻击成功率。

ABSTRACT

Fooling people with highly realistic fake images generated with Deepfake or GANs brings a great social disturbance to our society. Many methods have been proposed to detect fake images, but they are vulnerable to adversarial perturbations -- intentionally designed noises that can lead to the wrong prediction. Existing methods of attacking fake image detectors usually generate adversarial perturbations to perturb almost the entire image. This is redundant and increases the perceptibility of perturbations. In this paper, we propose a novel method to disrupt the fake image detection by determining key pixels to a fake image detector and attacking only the key pixels, which results in the $L_0$ and the $L_2$ norms of adversarial perturbations much less than those of existing works. Experiments on two public datasets with three fake image detectors indicate that our proposed method achieves state-of-the-art performance in both white-box and black-box attacks.

研究动机与目标

  • 解决现有对抗攻击方法在整幅图像上施加扰动所导致的感知明显度增加和计算成本上升的问题。
  • 同时降低对抗扰动的$L_0$和$L_2$范数,以提升不可察觉性。
  • 识别并仅针对虚假检测器用于分类的最具语义相关性的像素进行攻击。
  • 开发一种灵活的框架,集成多种攻击方法(如FGSM、DeepFool)以实现高效且有效的规避。
  • 在白盒和黑盒设置下均实现高攻击成功率,同时保持低感知明显度。

提出的方法

  • KRA利用多层关键语义区域选择(MLSKRS)识别关键像素,该方法结合多个卷积层的激活图以定位对检测至关重要的区域。
  • MLSKRS利用浅层和深层的空域与梯度信息,生成一个紧凑且高影响力的像素关键区域掩码$\mathcal{M}$。
  • 该方法将攻击问题重新表述为最小化$||r||_2 + ||\mathcal{M}||_0$,其中$r$为扰动,$\mathcal{M}$为关键像素集合,从而确保稀疏性与低失真。
  • KRA被设计为一个容器,集成标准的对抗攻击方法(如PGD、DeepFool),仅在选定的关键像素上生成扰动。
  • 该框架仅在掩码标记的关键区域上应用基于梯度的优化,极大减少了被修改的像素数量与计算成本。
  • 采用包含参数$t_\alpha = 0.8$、$t' = 0.1$和$\beta = 0.1$的阈值策略,以优化最终的关键像素掩码。

实验结果

研究问题

  • RQ1仅针对一小撮关键像素进行攻击,是否能显著干扰虚假图像检测,同时最小化感知明显度?
  • RQ2结合多个卷积层的特征图,是否能相比仅使用最后一层,更准确且更稀疏地检测关键像素?
  • RQ3同时降低$L_0$和$L_2$范数的扰动,是否能生成更不可察觉的对抗样本而不损失攻击成功率?
  • RQ4所提出的方法是否能在黑盒攻击场景中实现强迁移性?
  • RQ5当限制在关键像素上时,集成不同攻击算法(如PGD、DeepFool)对性能有何影响?

主要发现

  • KRA在白盒攻击中实现了SOTA成功率,将三种虚假检测器(Xception、Inception-v3、ResNet)的准确率降低至0.01以下。
  • KRA生成的扰动的$L_2$范数相比基于PGD的攻击降低了10倍,相比$L_2$最小化的基线方法降低了100倍。
  • KRA扰动的$L_0$范数比基于$L_0$的攻击方法低10倍,表明其扰动具有显著更高的稀疏性。
  • 在黑盒攻击中,KRA保持了强迁移性,攻击迁移率(ATR)维持在50% ± 15%之间,展现出优异的泛化能力。
  • 定性结果表明,扰动仅集中在关键区域,且对人类观察者而言完全不可察觉,即使归一化到[0,255]范围亦然。
  • 该方法通过仅将扰动限制在少量语义上有意义的像素子集上,实现了高效率,显著降低了计算量与感知明显度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。