[论文解读] Trust Region Based Adversarial Attack on Neural Networks
本文提出了一种基于信任域(TR)的对抗性攻击框架,能够高效生成小型、定向的扰动,以欺骗深度神经网络。通过利用一阶和二阶信任域优化,该方法在性能上可与Carlini-Wagner(CW)攻击相媲美,同时在VGG-16上将推理时间缩短至原来的1/37.5,且与DeepFool相比,扰动幅度最大减少3.9倍。
Deep Neural Networks are quite vulnerable to adversarial perturbations. Current state-of-the-art adversarial attack methods typically require very time consuming hyper-parameter tuning, or require many iterations to solve an optimization based adversarial attack. To address this problem, we present a new family of trust region based adversarial attacks, with the goal of computing adversarial perturbations efficiently. We propose several attacks based on variants of the trust region optimization method. We test the proposed methods on Cifar-10 and ImageNet datasets using several different models including AlexNet, ResNet-50, VGG-16, and DenseNet-121 models. Our methods achieve comparable results with the Carlini-Wagner (CW) attack, but with significant speed up of up to $37 imes$, for the VGG-16 model on a Titan Xp GPU. For the case of ResNet-50 on ImageNet, we can bring down its classification accuracy to less than 0.1\% with at most $1.5\%$ relative $L_\infty$ (or $L_2$) perturbation requiring only $1.02$ seconds as compared to $27.04$ seconds for the CW attack. We have open sourced our method which can be accessed at [1].
研究动机与目标
- 开发一种更快、更高效的对抗性攻击方法,以降低生成对抗样本的计算成本。
- 通过最小化扰动幅度来提升攻击成功率,同时保持高迁移性和目标性。
- 探索在对抗性攻击中应用信任域优化,结合一阶与二阶信息以提升收敛速度与鲁棒性。
- 在多种架构(如ResNet、VGG、DenseNet)和数据集(CIFAR-10、ImageNet)上,针对多种L2与Linfty范数进行评估。
- 证明基于信任域的攻击可达到或超越最先进性能(如CW),同时显著降低时间和扰动大小。
提出的方法
- 将攻击形式化为信任域优化问题,其中在当前输入周围的有界区域(信任域)内,使用局部二次模型近似损失曲面。
- 一阶信任域方法利用梯度信息,并自适应调整信任域半径,以平衡收敛速度与精度。
- 一种自适应变体基于模型近似质量动态调节信任域半径,从而消除对人工超参数调优的需求。
- 二阶信任域变体引入Hessian信息,以更好地捕捉非凸损失曲面中的曲率,尤其在具有非线性激活函数(如Swish)的模型中更具优势。
- 在每次迭代中求解一个凸二次约束二次规划(QCQP),以在信任域内找到最优扰动。
- 该框架应用于深度神经网络的白盒攻击,通过反向传播计算扰动,并通过投影操作保持范数约束。
实验结果
研究问题
- RQ1信任域优化能否有效用于生成扰动幅度更小、效率更高的对抗样本?
- RQ2在扰动大小与计算时间方面,基于信任域的攻击与最先进方法(如CW和DeepFool)相比表现如何?
- RQ3在包含非线性激活函数的模型中,引入二阶信息(Hessian)是否能提升攻击强度?
- RQ4自适应信任域半径选择是否能消除对手动超参数调优的依赖,同时保持或提升攻击性能?
- RQ5基于信任域的攻击在不同架构与数据集(包括ImageNet)上的泛化能力如何?
主要发现
- 在VGG-16模型上,基于信任域的攻击相比Carlini-Wagner(CW)攻击实现最高达37.5倍的加速,攻击时间从27.04秒缩短至1.02秒(在Titan Xp GPU上)。
- 在ImageNet上的ResNet-50上,TR攻击仅使用1.5%的相对Linfty或L2扰动,即可将模型准确率降至0.1%以下,性能与CW相当,但耗时显著更短。
- 与DeepFool相比,TR方法在WResNet上L2范数下的最坏类别攻击中,扰动幅度最大减少3.9倍。
- 在VGG-16上使用Linfty范数时,TR扰动比DeepFool小1.9倍,且更具针对性,展现出更高的精度与隐蔽性。
- 二阶TR变体优于一阶版本,在AlexNet上仅需2–3次迭代即可使模型准确率额外降低1.2%,尽管计算成本更高。
- 自适应TR变体在无需人工调参的情况下达到与非自适应版本相似的性能,仅因默认参数设置保守而略有扰动幅度的轻微增加。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。