[论文解读] AdvFlow: Inconspicuous Black-box Adversarial Attacks using Normalizing Flows
AdvFlow 提出了一种新颖的黑箱对抗攻击方法,利用预训练的归一化流来建模干净图像周围的数据分布,生成与自然数据结构高度一致的扰动。这使得生成的对抗样本更加隐蔽、更难被检测,同时在成功率、查询次数和防御模型上的迁移能力方面优于基线方法(如 $σ$-Attack)。
Deep learning classifiers are susceptible to well-crafted, imperceptible variations of their inputs, known as adversarial attacks. In this regard, the study of powerful attack models sheds light on the sources of vulnerability in these classifiers, hopefully leading to more robust ones. In this paper, we introduce AdvFlow: a novel black-box adversarial attack method on image classifiers that exploits the power of normalizing flows to model the density of adversarial examples around a given target image. We see that the proposed method generates adversaries that closely follow the clean data distribution, a property which makes their detection less likely. Also, our experimental results show competitive performance of the proposed approach with some of the existing attack methods on defended classifiers. The code is available at https://github.com/hmdolatabadi/AdvFlow.
研究动机与目标
- 开发一种能够生成难以察觉、符合数据结构的扰动的黑箱对抗攻击,以逃避检测。
- 利用归一化流对干净图像周围的真正数据分布进行建模,确保对抗样本保持在自然数据流形之内。
- 通过使扰动在分布上与干净数据难以区分,提升对对抗检测的鲁棒性。
- 在防御模型上实现更高的成功率和更低的查询次数,优于现有黑箱攻击方法。
- 证明基于流的扰动相较于独立加性噪声方法(如 $σ$-Attack)具有优越性。
提出的方法
- 在干净数据上预训练归一化流,以学习底层数据分布。
- 利用学习到的流来参数化对抗扰动的搜索分布,确保其符合自然数据结构。
- 在黑箱设置下,应用自然进化策略(NES)结合搜索梯度,优化扰动分布。
- 通过迭代查询目标模型,并利用梯度估计更新基于流的分布,逐步优化扰动。
- 从优化后的基于流的分布中采样生成对抗样本,其结构与干净数据高度相似。
- 证明一个引理:AdvFlow 的扰动可近似为具有依赖分量的正态分布,而 $σ$-Attack 中的噪声为独立分量。
实验结果
研究问题
- RQ1归一化流能否有效用于生成符合自然数据分布的黑箱对抗样本?
- RQ2AdvFlow 生成的扰动在分布上的相似性如何影响其被对抗样本检测器发现的可能性?
- RQ3通过基于流的分布建模扰动,是否能相比加性噪声基线方法实现更高的攻击成功率和更低的查询次数?
- RQ4AdvFlow 在防御模型上的表现如何,特别是在迁移能力和鲁棒性方面?
- RQ5即使归一化流为随机初始化而未进行预训练,AdvFlow 是否仍能生成有效的对抗样本?
主要发现
- 在 ImageNet 的 Inception-v3 上,AdvFlow 的成功率达到了 97.78%,平均查询次数为 375.00(中位数为 200),优于 $σ$-Attack(95.06%)和 Bandits(87.80%)的查询效率。
- 在 VGG16 上,AdvFlow 的成功率达到了 99.57%,平均查询次数仅为 395.61(中位数为 200),在效率上超越了 $σ$-Attack(99.57%)和 Bandits(95.46%)。
- 对于防御模型 Def. ResNet,AdvFlow 的成功率达到了 57.20%,平均查询次数为 381.97(中位数为 200),显著优于 $σ$-Attack(33.99%)和 Bandits(50.77%)。
- 视觉对比显示,AdvFlow 的扰动保留了图像结构,且比 $σ$-Attack 的像素级独立噪声更难被检测。
- 论文中证明的引理确认,AdvFlow 的扰动具有依赖分量,从而实现更自然、更符合数据一致性的扰动。
- 即使在归一化流随机初始化而未预训练的情况下,AdvFlow 在 Inception-v3 上仍实现了 97.78% 的成功率,优于 Bandits 和 $σ$-Attack 的成功率与查询效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。