[论文解读] Improved Network Robustness with Adversary Critic
本文提出了一种基于 GAN 的新型防御方法,通过使对抗性样本与目标类别的真实自然图像难以区分,来训练鲁棒分类器。通过将对抗性攻击视为生成器,并使用判别器来区分真实图像与对抗性图像,该方法在标准对抗性训练的基础上进一步提升了鲁棒性,且人工评估证实对抗性样本在视觉上具有迷惑性。
Ideally, what confuses neural network should be confusing to humans. However, recent experiments have shown that small, imperceptible perturbations can change the network prediction. To address this gap in perception, we propose a novel approach for learning robust classifier. Our main idea is: adversarial examples for the robust classifier should be indistinguishable from the regular data of the adversarial target. We formulate a problem of learning robust classifier in the framework of Generative Adversarial Networks (GAN), where the adversarial attack on classifier acts as a generator, and the critic network learns to distinguish between regular and adversarial images. The classifier cost is augmented with the objective that its adversarial examples should confuse the adversary critic. To improve the stability of the adversarial mapping, we introduce adversarial cycle-consistency constraint which ensures that the adversarial mapping of the adversarial examples is close to the original. In the experiments, we show the effectiveness of our defense. Our method surpasses in terms of robustness networks trained with adversarial training. Additionally, we verify in the experiments with human annotators on MTurk that adversarial examples are indeed visually confusing. Codes for the project are available at https://github.com/aam-at/adversary_critic.
研究动机与目标
- 为弥合神经网络对不可察觉扰动的脆弱性与人类感知之间的差距,其中对抗性样本应具有视觉迷惑性。
- 开发一种防御机制,确保对抗性样本在语义上具有意义且在视觉上合理,而非语义上无意义的扰动。
- 通过引入评估对抗性样本真实感的判别器网络,将鲁棒性提升至超过标准对抗性训练的水平。
- 确保对抗性样本不仅能够欺骗分类器,还能在人类观察者眼中显得自然。
- 引入循环一致性约束,以稳定对抗性映射过程。
提出的方法
- 将鲁棒分类器的训练建模为 GAN 框架,其中对抗性攻击充当生成器,判别器网络用于区分真实图像与对抗性图像。
- 提出一种完全可微、依赖于参数的定向对抗性攻击,基于当前分类器权重生成对抗性样本。
- 在分类器损失中增加判别器损失,要求对抗性样本能够欺骗判别器,从而强制实现视觉上的合理性。
- 应用对抗性循环一致性约束,确保对抗性样本的对抗性映射结果接近原始输入,从而提升稳定性。
- 通过反向传播联合训练分类器与判别器,实现对两个组件的端到端优化。
- 采用一种新型攻击策略,其隐式依赖于分类器参数,并经过优化以生成在视觉上真实且与目标类别语义一致的对抗性样本。
实验结果
研究问题
- RQ1能否使对抗性样本在视觉上与目标类别的自然图像难以区分,从而提升人类的混淆程度?
- RQ2基于 GAN 的防御框架是否通过训练判别器来检测对抗性样本,从而在鲁棒性上优于标准对抗性训练?
- RQ3人类感知下,由所提方法生成的对抗性样本在多大程度上改变了其真实底层标签?
- RQ4循环一致性约束在多大程度上提升了对抗性样本的稳定性和质量?
- RQ5所提方法是否能在保持高干净准确率的同时实现更高的鲁棒性,并生成语义上有意义的对抗性样本?
主要发现
- 在使用全连接网络的 MNIST 数据集上,所提方法在所提攻击下的鲁棒性得分为 0.590,优于 [7](0.286)和 [19](0.470)等对抗性训练方法。
- 对于 LeNet-5 架构,该方法的鲁棒性得分为 0.590,显著优于 [7](0.286)、[16](0.330)和 [19](0.470)。
- 在 Amazon Mechanical Turk 上的人工评估中,87.99% 的由所提防御生成的对抗性样本被人工标注者正确识别为目标类别,而 [19] 为 60.47%,[7] 仅为 19.02%。
- 人工研究显示,9.86% 的对抗性样本被人类误分类为原始类别,表明大多数对抗性样本在视觉上具有说服力且语义上合理。
- 该方法在 LeNet-5 上对干净 MNIST 图像的测试误差为 0.93%,表明其在干净数据上具有强大的泛化能力。
- 对抗性循环一致性约束提升了对抗性映射的稳定性,确保对抗性样本在分布上保持接近原始输入。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。