Skip to main content
QUICK REVIEW

[论文解读] Protecting Against Image Translation Deepfakes by Leaking Universal Perturbations from Black-Box Neural Networks

Nataniel Ruiz, Sarah Adel Bargal|arXiv (Cornell University)|Jun 11, 2020
Adversarial Robustness in Machine Learning参考文献 42被引用 8
一句话总结

该论文提出了一种新型的黑箱攻击方法——漏泄通用扰动(Leaking Universal Perturbations, LUP),用于降低在干扰图像翻译深度伪造系统(如 GANimation 和 StarGAN)时的查询效率。通过采用两阶段方法——首先进行短暂的漏泄阶段,从对抗性扰动中提取可迁移的主成分分析(PCA)分量,随后在利用阶段使用这些分量——LUP 相较于最先进方法,将平均查询次数减少了 30%。

ABSTRACT

In this work, we develop efficient disruptions of black-box image translation deepfake generation systems. We are the first to demonstrate black-box deepfake generation disruption by presenting image translation formulations of attacks initially proposed for classification models. Nevertheless, a naive adaptation of classification black-box attacks results in a prohibitive number of queries for image translation systems in the real-world. We present a frustratingly simple yet highly effective algorithm Leaking Universal Perturbations (LUP), that significantly reduces the number of queries needed to attack an image. LUP consists of two phases: (1) a short leaking phase where we attack the network using traditional black-box attacks and gather information on successful attacks on a small dataset and (2) and an exploitation phase where we leverage said information to subsequently attack the network with improved efficiency. Our attack reduces the total number of queries necessary to attack GANimation and StarGAN by 30%.

研究动机与目标

  • 为解决在真实世界黑箱环境中(模型权重和梯度未知)图像翻译深度伪造系统对对抗性攻击的脆弱性问题。
  • 降低传统黑箱攻击在图像翻译模型上所需的极高查询次数。
  • 开发一种可扩展、高效的攻击方法,实现在无需白箱访问的情况下对深度伪造生成进行实际干扰。
  • 证明初始攻击中提取的可迁移扰动可被用于提升后续攻击的效率。

提出的方法

  • LUP 框架包含两个阶段:第一阶段为短暂的漏泄阶段,对小规模数据集应用传统黑箱攻击(如 SimBA)以生成对抗性扰动。
  • 在漏泄阶段,对收集到的扰动应用主成分分析(PCA),以提取主要的、可迁移的攻击方向。
  • 在利用阶段,将这些 PCA 分量用作改进版 SimBA 算法中的候选攻击向量,以更高效地针对新图像实施攻击。
  • 若攻击损失达到饱和且未取得成功,算法将回退至默认的图像基底以完成攻击。
  • 该方法利用了不同图像之间对抗性扰动之间的相关性,从而实现更快的收敛。
  • 该方法应用于 CelebA 数据集上的图像翻译模型,如 GANimation 和 StarGAN。

实验结果

研究问题

  • RQ1黑箱对抗性攻击能否被有效适配于深度伪造生成中使用的图像翻译模型?
  • RQ2初始对抗性攻击中获取的信息能否被用于减少后续攻击所需的查询次数?
  • RQ3通过 PCA 学习得到的扰动是否具有可迁移性,并能提升图像翻译系统中的攻击效率?
  • RQ4与最先进黑箱攻击方法(如 SimBA 和 Bandits-TD)相比,LUP 方法在查询效率和成功率方面表现如何?

主要发现

  • 与 IT-SimBA 相比,LUP 在 GANimation 和 StarGAN 上将成功攻击单张图像所需的平均查询次数减少了约 30%。
  • 在 GANimation 上使用 LUP 攻击 100,000 张图像,总查询次数估计为 3940 万,而使用 IT-SimBA 则为 5510 万,减少了 1570 万次查询。
  • 该方法在测试数据集上实现了 100% 的成功率,且对抗样本对人类观察者保持不可察觉。
  • Bandits-TD 在图像分类任务中表现良好,但在图像翻译场景中表现欠佳,可能是因为时间步长之间梯度相关性较差。
  • 漏泄阶段成功捕获了可迁移的扰动模式,证实图像翻译模型在不同输入间存在可被利用的相关性。
  • 如查询分布的左偏直方图所示,LUP 在较低查询次数下的累积攻击成功率显著更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。