[论文解读] An ADMM-Based Universal Framework for Adversarial Attacks on Deep Neural Networks
该论文提出了一种基于ADMM的通用框架,统一了深度神经网络中$ L_0 $、$ L_1 $、$ L_2 $和$ L_\infty $对抗攻击,实现了高效率、基于优化的对抗样本生成,且失真最小。该方法在所有范数下均实现了100%的攻击成功率,并在失真降低方面达到最先进水平,优于先前的C&W和EAD攻击方法。
Deep neural networks (DNNs) are known vulnerable to adversarial attacks. That is, adversarial examples, obtained by adding delicately crafted distortions onto original legal inputs, can mislead a DNN to classify them as any target labels. In a successful adversarial attack, the targeted mis-classification should be achieved with the minimal distortion added. In the literature, the added distortions are usually measured by L0, L1, L2, and L infinity norms, namely, L0, L1, L2, and L infinity attacks, respectively. However, there lacks a versatile framework for all types of adversarial attacks. This work for the first time unifies the methods of generating adversarial examples by leveraging ADMM (Alternating Direction Method of Multipliers), an operator splitting optimization approach, such that L0, L1, L2, and L infinity attacks can be effectively implemented by this general framework with little modifications. Comparing with the state-of-the-art attacks in each category, our ADMM-based attacks are so far the strongest, achieving both the 100% attack success rate and the minimal distortion.
研究动机与目标
- 解决深度神经网络中针对多种$ L_p $范数($ L_0 $、$ L_1 $、$ L_2 $、$ L_\infty $)缺乏统一对抗样本生成框架的问题。
- 开发一种通用的基于优化的攻击方法,在确保高攻击成功率的同时实现最小失真。
- 评估防御机制(如防御蒸馏和对抗训练)对所提攻击的鲁棒性。
- 研究由ADMM框架生成的对抗样本在不同模型和防御技术之间的迁移性。
提出的方法
- 利用交替方向乘子法(ADMM)将对抗攻击生成的非凸、组合优化问题分解为两个子问题:一个用于扰动更新,另一个用于约束强制执行。
- 利用ADMM的交替最小化和增广拉格朗日框架,高效求解$ L_p $-范数约束的优化问题,实现线性收敛速率。
- 通过修改增广拉格朗日函数中的正则化项和约束项,将ADMM框架适配于不同$ L_p $范数,使单一核心算法可支持全部四种攻击类型,仅需极少代码修改。
- 在白盒攻击设置下运行,可完全访问模型架构和参数,并将攻击建模为在确保误分类为目标标签的前提下最小化扰动的$ L_p $范数。
- 集成基于梯度的反向传播以进行模型预测,并利用ADMM迭代逐步优化对抗扰动,平衡攻击成功率与失真最小化。
- 将该框架应用于MNIST、CIFAR-10和ImageNet数据集,生成对抗样本,并评估其对防御蒸馏和对抗训练的鲁棒性。
实验结果
研究问题
- RQ1是否能通过单一统一的优化框架,在深度神经网络中有效生成所有主要$ L_p $范数($ L_0 $、$ L_1 $、$ L_2 $、$ L_\infty $)的对抗样本?
- RQ2在不同$ L_p $范数下,ADMM攻击在失真和成功率方面与C&W和EAD等最先进攻击方法相比表现如何?
- RQ3ADMM生成的对抗样本在多大程度上能够突破防御蒸馏和对抗训练等防御机制?
- RQ4由ADMM框架生成的对抗样本在其他模型上的迁移性如何,尤其是在目标模型采用防御技术时?
主要发现
- ADMM攻击在MNIST、CIFAR-10和ImageNet上对所有$ L_p $范数($ L_0 $、$ L_1 $、$ L_2 $、$ L_\infty $)均实现了100%的攻击成功率,优于现有方法。
- 在MNIST和CIFAR-10上,ADMM攻击的$ L_\infty $失真在最坏情况下比IFGM攻击低最多40%。
- 在ImageNet上,ADMM攻击的$ L_\infty $失真比IFGM攻击低64%,显著提升了最小失真性能。
- ADMM攻击在各种温度参数($ T = 1, 10, 100 $)下,成功突破了防御蒸馏模型,实现了100%的攻击成功率。
- 当应用于对抗训练模型时,ADMM的$ L_2 $攻击在所有三个测试网络(未防御、使用C&W样本训练、使用ADMM样本训练)上均保持100%成功率,且在防御模型上的失真更高,表明防御机制的有效性。
- 对于$ L_2 $攻击,当置信度参数$ \kappa > 40 $时,ADMM生成的对抗样本在蒸馏模型($ T=100 $)上的迁移性优于C&W生成的样本,当$ \kappa=50 $时,ADMM的攻击成功率(ASR)接近98%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。