Skip to main content
QUICK REVIEW

[论文解读] Universal Adversarial Perturbations Through the Lens of Deep Steganography: Towards A Fourier Perspective

Chaoning Zhang, Philipp Benz|arXiv (Cornell University)|Feb 12, 2021
Adversarial Robustness in Machine Learning参考文献 64被引用 4
一句话总结

本文提出一种统一的傅里叶视角,以解释通用对抗扰动(UAPs)与深度隐写术,表明两者均因深度神经网络对高频(HF)内容的高度敏感性而成功。本文引入一种频率熵度量,揭示在UAPs下高频分量主导模型预测结果,并提出两种新型攻击变体:用于双重目的攻击的通用秘密对抗扰动(USAP),以及实现更高视觉不可见性的高通UAP(HP-UAP),在保持95.8%欺骗率的同时显著降低可见性。

ABSTRACT

The booming interest in adversarial attacks stems from a misalignment between human vision and a deep neural network (DNN), i.e. a human imperceptible perturbation fools the DNN. Moreover, a single perturbation, often called universal adversarial perturbation (UAP), can be generated to fool the DNN for most images. A similar misalignment phenomenon has recently also been observed in the deep steganography task, where a decoder network can retrieve a secret image back from a slightly perturbed cover image. We attempt explaining the success of both in a unified manner from the Fourier perspective. We perform task-specific and joint analysis and reveal that (a) frequency is a key factor that influences their performance based on the proposed entropy metric for quantifying the frequency distribution; (b) their success can be attributed to a DNN being highly sensitive to high-frequency content. We also perform feature layer analysis for providing deep insight on model generalization and robustness. Additionally, we propose two new variants of universal perturbations: (1) Universal Secret Adversarial Perturbation (USAP) that simultaneously achieves attack and hiding; (2) high-pass UAP (HP-UAP) that is less visible to the human eye.

研究动机与目标

  • 通过统一的傅里叶视角解释通用对抗扰动(UAPs)与深度隐写术的成功原因。
  • 探究频率内容——尤其是高频(HF)——是否为人类感知与DNN行为之间错位的关键因素。
  • 提出一种无需超参数调优的频率分布定量度量方法。
  • 提出新型通用攻击变体,实现对抗鲁棒性与隐写隐藏或更高视觉不可见性的结合。
  • 通过分析特征层动态,理解在高频(HF)与低频(LF)内容背景下模型的泛化与鲁棒性。

提出的方法

  • 提出一种新颖的频率熵度量,无需超参数调优即可定量评估图像中频率分量的分布。
  • 应用傅里叶视角分析UAPs与深度隐写术,对比扰动(P)与原始图像(I)在频域中的表现。
  • 在UAP生成流程中引入可微分高通滤波器(HPF),生成HP-UAP,降低可见性同时保持高欺骗率。
  • 通过将USP生成框架与对抗损失结合,提出通用秘密对抗扰动(USAP),使单一扰动可同时实现攻击与秘密数据隐藏。
  • 在多个网络层中计算干净输入、扰动输入与纯扰动输入的特征图之间的余弦相似度,分析模型注意力与影响动态。
  • 对任务(UAP与深度隐写术)进行联合分析,比较频率在模型错位与鲁棒性中的作用。

实验结果

研究问题

  • RQ1频率内容——尤其是高频分量——在多大程度上决定了通用对抗扰动的成功?
  • RQ2人类感知与DNN行为在对抗攻击与深度隐写术中的错位,能否通过统一的傅里叶域框架加以解释?
  • RQ3输入图像的频率分布在多大程度上影响其对通用对抗扰动的鲁棒性?
  • RQ4能否设计一种单一扰动,实现同时具备高不可见性的对抗攻击与秘密数据隐藏(即隐写术)?
  • RQ5DNN不同层的特征表示对高频与低频扰动的响应方式如何?

主要发现

  • UAPs的成功主要源于DNN对高频(HF)内容的高敏感性,而非低频(LF)内容,该结论通过特征层分析与所提出的熵度量得到验证。
  • 高频熵(HE)较高的图像对UAPs具有显著更强的鲁棒性:HE图像在早期层的干净与扰动特征余弦相似度降至约0.9,后期层降至约0.75;而低熵(LE)图像则降至约0.0。
  • 高通UAP(HP-UAP)在VGG19上实现90.1%的欺骗率,带宽为60,相较于基线94.4%(bw=0)略有下降,但人类视觉系统明显更难察觉。
  • 通用秘密对抗扰动(USAP)在VGG19上实现95.8%的欺骗率,同时成功嵌入并恢复秘密图像,证明了双重用途扰动的可行性。
  • 特征层分析表明,高频扰动主导后期层,而低频特征影响早期层;UAPs引入独立的人工特征,影响所有层,与实例相关扰动(IDPs)不同。
  • 随机噪声对后期层影响有限,表明DNN对噪声具有鲁棒性,但对结构化高频对抗扰动高度敏感。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。