Skip to main content
QUICK REVIEW

[论文解读] Generalizable Adversarial Attacks with Latent Variable Perturbation Modelling

Avishek Joey Bose, Andre Cianflone|arXiv (Cornell University)|May 26, 2019
Adversarial Robustness in Machine Learning参考文献 37被引用 5
一句话总结

该论文提出GAALV,一种面向白盒对抗攻击的、与领域无关的生成式框架,通过将对抗扰动建模为随机潜在变量分布,实现高效、多样且零样本的攻击泛化。该框架采用变分自编码器(VAE)结构的编码器-解码器模型进行训练,可在图像、文本和图数据上实现高效、多样且零样本的攻击泛化,在图领域达到最先进性能,在其他领域也表现出竞争力。

ABSTRACT

Adversarial attacks on deep neural networks traditionally rely on a constrained optimization paradigm, where an optimization procedure is used to obtain a single adversarial perturbation for a given input example. In this work we frame the problem as learning a distribution of adversarial perturbations, enabling us to generate diverse adversarial distributions given an unperturbed input. We show that this framework is domain-agnostic in that the same framework can be employed to attack different input domains with minimal modification. Across three diverse domains---images, text, and graphs---our approach generates whitebox attacks with success rates that are competitive with or superior to existing approaches, with a new state-of-the-art achieved in the graph domain. Finally, we demonstrate that our framework can efficiently generate a diverse set of attacks for a single given input, and is even capable of attacking extit{unseen} test instances in a zero-shot manner, exhibiting attack generalization.

研究动机与目标

  • 解决基于约束优化的对抗攻击方法存在的效率低下、缺乏多样性以及跨模态泛化困难等问题。
  • 实现在无需重新优化的情况下,对未见测试样本实现高效、零样本的攻击泛化。
  • 通过将扰动建模为可学习的潜在分布,为单个输入生成多样化的对抗扰动。
  • 使用单一框架并仅做最小的架构修改,统一图像、文本和图等多样化输入领域的对抗攻击生成。
  • 在实现高效推理和重采样的同时,攻击成功率相比最先进方法达到竞争力或更优表现。

提出的方法

  • GAALV采用编码器-解码器架构,引入随机潜在变量 z,其中编码器将输入 x 映射为潜在码,解码器则从 z 生成对抗扰动 δ。
  • 框架采用类似变分自编码器(VAE)的目标函数,并引入KL散度正则项,以确保潜在空间结构良好且解耦。
  • 对抗样本生成为 x' = x + δ,其中 δ 从解码器输出分布中采样,攻击目标是最大化分类错误率,同时最小化扰动幅度。
  • 重建损失确保扰动后的输入在分布上与原始输入保持接近,分类损失则促使模型 f 对扰动输入产生误分类。
  • 框架采用重参数化技巧实现端到端训练,支持近似推理:训练完成后,仅需一次前向传播即可生成对抗样本。
  • 对于零样本泛化,模型在未见测试输入上直接生成对抗样本,无需进一步优化,充分利用学习到的潜在分布。

实验结果

研究问题

  • RQ1基于潜在变量建模的统一生成式框架,是否能在图像、文本和图等多样化输入领域实现有效的对抗攻击?
  • RQ2将对抗扰动建模为分布,是否能实现无需重新优化的、对未见测试样本的高效零样本攻击泛化?
  • RQ3该框架是否能为单个输入生成多样化的对抗样本,从而在攻击失败时支持重采样?
  • RQ4与最先进基于约束优化的攻击方法相比,该方法在攻击成功率和效率方面表现如何?
  • RQ5该框架是否能在图领域实现最先进性能,而该领域先前方法面临显著挑战?

主要发现

  • 在Cora图数据集上,GAALV在直接攻击中实现了93%的新最先进攻击成功率,超越了先前方法Zugner(在训练集上达99%,但测试集表现更低)。
  • 在CiteSeer数据集上,GAALV在直接攻击中达到92%的成功率,在影响者攻击中达到54%,显著优于先前最先进方法(影响者攻击仅38%)。
  • 在图像领域,GAALV在CIFAR-10测试集上达到81%的攻击成功率,与PGD和Carlini-Wagner攻击性能相当,同时支持零样本泛化。
  • 在IMDB文本基准上,GAALV-Diff在测试集上达到61%的成功率——首次实现对完整测试集的可扩展、高性能攻击,达到最先进水平。
  • GAALV展现出强大的零样本泛化能力:在未见测试样本上无需进一步优化即可成功攻击,Cora数据集直接攻击中成功率相比基线方法最高提升61%。
  • 该框架支持高效的对抗样本重采样,当在IMDB上重采样失败攻击时,成功率提升至71%,体现出多样性在规避防御中的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。