Skip to main content
QUICK REVIEW

[论文解读] Internal Wasserstein Distance for Adversarial Attack and Defense

Wang, Qicheng, Shuhai Zhang|arXiv (Cornell University)|Mar 13, 2021
Adversarial Robustness in Machine Learning参考文献 34被引用 4
一句话总结

本文提出了一种内部Wasserstein距离(IWD),用于衡量图像之间的语义相似性,从而实现更有效的对抗性攻击与防御。通过利用IWD生成多样化且语义相似的对抗性样本,该方法在ℓp方法的基础上实现了更大的扰动,并通过基于IWD的对抗性训练提升了鲁棒性,在ImageNet上的对抗攻击成功率和防御准确率方面均优于现有方法。

ABSTRACT

Deep neural networks (DNNs) are known to be vulnerable to adversarial attacks that would trigger misclassification of DNNs but may be imperceptible to human perception. Adversarial defense has been an important way to improve the robustness of DNNs. Existing attack methods often construct adversarial examples relying on some metrics like the $\ell_p$ distance to perturb samples. However, these metrics can be insufficient to conduct adversarial attacks due to their limited perturbations. In this paper, we propose a new internal Wasserstein distance (IWD) to capture the semantic similarity of two samples, and thus it helps to obtain larger perturbations than currently used metrics such as the $\ell_p$ distance. We then apply the internal Wasserstein distance to perform adversarial attack and defense. In particular, we develop a novel attack method relying on IWD to calculate the similarities between an image and its adversarial examples. In this way, we can generate diverse and semantically similar adversarial examples that are more difficult to defend by existing defense methods. Moreover, we devise a new defense method relying on IWD to learn robust models against unseen adversarial examples. We provide both thorough theoretical and empirical evidence to support our methods.

研究动机与目标

  • 为解决ℓp范数在衡量对抗性样本语义相似性方面的局限性,这些局限性限制了扰动的多样性与有效性。
  • 开发一种新攻击方法,通过利用数据流形结构生成更多样化且鲁棒的对抗性样本。
  • 设计一种基于IWD的防御机制,以提升模型对未见对抗攻击的泛化能力与鲁棒性。
  • 从理论上推导攻击误差的上界,为基于IWD训练的鲁棒防御设计提供指导。
  • 证明:覆盖数据流形盲区的多样化对抗性样本可增强模型的鲁棒性。

提出的方法

  • 提出内部Wasserstein距离(IWD)作为度量,以捕捉图像之间的内在数据分布与语义相似性,替代传统的ℓp范数。
  • 开发一种攻击方法(IWDA),利用IWD在数据流形上生成具有大且语义一致扰动的对抗性样本。
  • 基于IWD推导攻击分类误差的上界,该上界为新型防御方法(IWDD)的设计提供依据。
  • 设计一种防御策略(IWDD),通过使用IWD优化的对抗性样本进行模型训练,以提升对未见攻击的鲁棒性。
  • 采用双重优化框架,其中IWD通过学习到的特征空间计算,从而实现高效的基于梯度的攻击与鲁棒训练。
  • 使用预训练模型(如ResNet-101、Inception-v3)并在tiny ImageNet上评估攻击与防御性能。

实验结果

研究问题

  • RQ1是否存在一种非ℓp范数的度量方法,能更有效地捕捉语义相似性,以生成高效的对抗性样本?
  • RQ2如何在实现更大扰动的同时,使对抗性样本更具多样性且语义一致?
  • RQ3基于IWD的对抗性训练能否提升对未见对抗攻击的鲁棒性?
  • RQ4IWD与攻击成功率之间存在何种理论关系?该关系如何指导防御设计?
  • RQ5在数据流形上生成对抗性样本是否能提升深度神经网络的泛化能力与鲁棒性?

主要发现

  • IWDA在所有方法中实现了最高的平均ℓ2与ℓ∞扰动距离,表明其在欧氏空间中具有更大的对抗扰动。
  • 尽管欧氏空间扰动较大,IWDA的IWD值最小(接近零),证实原始图像与对抗性图像之间具有高度语义相似性。
  • IWDD在PGD-10与FWAdv攻击下实现了优于或相当的鲁棒性,且在干净准确率上仅有轻微损失。
  • 消融实验表明,τ=0.1与β=0.1在IWDA与IWDD中均实现了干净准确率与鲁棒准确率的最佳平衡。
  • 定性结果表明,IWDA生成的对抗性样本多样化、真实感强且语义不变,而基线方法常导致分辨率或平滑度的失真。
  • 理论分析证实,通过覆盖数据流形盲区的多样化对抗性样本可提升鲁棒性,该结论在ImageNet上得到实证验证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。