[论文解读] Generating Realistic Unrestricted Adversarial Inputs using Dual-Objective GAN Training.
本文提出了一种双目标生成对抗网络(GAN)框架,通过联合训练生成器以欺骗目标分类器,同时生成与真实数据难以区分的样本,从而生成逼真且无限制的对抗性输入。人工评估显示,这些对抗性样本仅约50%的时间被正确识别为虚假,表明其具有中等程度的真实性。
The correctness of deep neural networks is well-known to be vulnerable to small, 'adversarial' perturbations of their inputs. Although studying these attacks is valuable, they do not necessarily conform to any real-world threat model. This has led to interest in the generation of (and robustness to) unrestricted adversarial inputs, which are not constructed as small perturbations of correctly-classified ground-truth inputs. We introduce a novel algorithm to generate realistic unrestricted adversarial inputs, in the sense that they cannot reliably be distinguished from the training dataset by a human. This is achieved by modifying generative adversarial networks: a generator neural network is trained to construct examples that deceive a fixed target network (so they are adversarial) while also deceiving the usual co-training discriminator network (so they are realistic). Our approach is demonstrated by the generation of unrestricted adversarial inputs for a trained image classifier that is robust to perturbation-based attacks. We find that human judges are unable to identify which image out of ten was generated by our method about 50 percent of the time, providing evidence that they are moderately realistic.
研究动机与目标
- 解决依赖于微小、不可察觉扰动的对抗性攻击所存在的局限性,这些扰动与现实世界威胁模型不一致。
- 生成既会被目标模型错误分类,又对人类观察者具有视觉真实感的无限制对抗性输入。
- 在简单扰动之外提升对抗性样本的真实性,使其更符合现实世界中的规避场景。
- 开发一种训练框架,通过改进的GAN架构,同时优化对抗性攻击成功率与数据真实性。
提出的方法
- 训练生成器网络,使其生成能对固定目标分类器构成对抗性攻击的输入,确保分类错误。
- 同一生成器同时被训练以欺骗协同训练的判别器网络,确保其生成的样本与训练数据分布具有真实性。
- 通过结合目标分类器的对抗性损失与数据判别器的对抗性损失,对生成器进行双目标损失优化。
- 在生成器训练过程中,目标分类器保持固定,以确保生成的输入是专门设计用于引发分类错误。
- 训练过程利用标准GAN训练动态,但引入双重监督信号:一个用于欺骗分类器,一个用于欺骗数据判别器。
- 该方法能够生成无限制的对抗性样本——即不被限制为干净输入的微小扰动——从而扩展了真实攻击场景的范围。
实验结果
研究问题
- RQ1能否生成既对目标分类器高度具有欺骗性,又对人类观察者具有视觉真实感的对抗性样本?
- RQ2基于GAN的生成器在多大程度上能够生成与真实数据难以区分的无限制对抗性输入?
- RQ3与标准对抗性训练相比,双目标训练方案在真实感和攻击有效性方面表现如何?
- RQ4人类评判者能否可靠地检测出该方法生成的对抗性样本,从而体现其真实性?
- RQ5在无限制对抗性样本生成中,对抗性成功与数据真实感之间存在何种权衡?
主要发现
- 人类评判者在十张图像中无法正确识别对抗性样本的时间约为50%,表明其具有中等真实性。
- 生成的对抗性样本成功欺骗了对传统基于扰动的攻击具有鲁棒性的目标分类器。
- 双目标训练框架成功平衡了对抗性输入的生成与真实样本的生成。
- 该方法生成了不受限于干净图像微小扰动的无限制对抗性输入,扩展了真实攻击场景的范围。
- 协同训练的判别器有效引导生成器生成与训练数据分布视觉一致的样本。
- 结果表明,通过带有双重监督的改进GAN架构,可以生成逼真且无限制的对抗性样本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。