Skip to main content
QUICK REVIEW

[论文解读] Mathematical Analysis of Adversarial Attacks

Zehao Dou, Stanley Osher|arXiv (Cornell University)|Nov 15, 2018
Adversarial Robustness in Machine Learning参考文献 27被引用 9
一句话总结

本文对对抗性攻击进行了数学分析,证明了在小扰动下,无目标和有目标的快速梯度符号法(FGSM)能够欺骗任意使用ReLU激活的卷积神经网络(CNN)。对于两层网络,研究展示了Carlini-Wagner $L_2$(CW-L2)攻击提高了目标类与真实类之间的概率比,该结论在CIFAR-10数据集上使用ResNet56进行了数值验证。

ABSTRACT

In this paper, we analyze efficacy of the fast gradient sign method (FGSM) and the Carlini-Wagner's L2 (CW-L2) attack. We prove that, within a certain regime, the untargeted FGSM can fool any convolutional neural nets (CNNs) with ReLU activation; the targeted FGSM can mislead any CNNs with ReLU activation to classify any given image into any prescribed class. For a special two-layer neural network: a linear layer followed by the softmax output activation, we show that the CW-L2 attack increases the ratio of the classification probability between the target and ground truth classes. Moreover, we provide numerical results to verify all our theoretical results.

研究动机与目标

  • 对无目标和有目标的FGSM攻击在ReLU激活的深度神经网络上的有效性进行理论分析。
  • 建立无目标和有目标FGSM能够成功欺骗任意ReLU激活CNN的条件。
  • 研究CW-L2攻击在两层网络中对目标类与真实类之间分类概率比的影响。
  • 通过在CIFAR-10基准上对ResNet56进行数值实验,验证理论发现。
  • 为实际应用中针对和无目标对抗性攻击提供理论指导。

提出的方法

  • 证明当攻击强度 $\epsilon$ 较小时,无目标FGSM可通过在 $L_\infty$ 扰动约束下最大化损失,从而欺骗任意ReLU激活的CNN。
  • 推导有目标FGSM的更新规则:$x' = x - \epsilon \cdot \text{sign}(\nabla_x L(x, e_t))$,其中 $e_t$ 为独热编码的目标标签。
  • 分析两层网络(全连接层+Softmax)上的CW-L2攻击,表明其提高了目标类与真实类之间分类概率的比值。
  • 使用一阶近似推导FGSM更新:对于无目标攻击,$x' = x + \epsilon \cdot \text{sign}(\nabla_x L(x, y))$。
  • 实现迭代FGSM(IFGSM),通过裁剪保持扰动边界:$x^{(m)} = \text{Clip}_{x,\alpha}\{x^{(m-1)} + \epsilon \cdot \text{sign}(\nabla_x L(x^{(m-1)}, y))\}$。
  • 使用Adam优化器,设置 $c=10$,$\kappa=0$,学习率 $0.01$,在10次迭代内求解CW-L2目标函数,以实现数值验证。

实验结果

研究问题

  • RQ1在何种条件下,无目标FGSM攻击能够成功欺骗任意ReLU激活的CNN?
  • RQ2有目标FGSM攻击是否能可靠地将任意输入图像误分类为预设的目标类别,适用于ReLU激活网络?
  • RQ3CW-L2攻击如何影响两层网络中目标类与真实类之间的相对分类概率?
  • RQ4攻击强度 $\epsilon$ 与FGSM和IFGSM攻击在ResNet56上的成功率之间存在何种关系?
  • RQ5在实际中,CW-L2攻击在多大程度上将预测的概率分布推向目标类别?

主要发现

  • 当 $\epsilon$ 较小时,无目标FGSM攻击在ResNet56上的分类准确率单调下降,且当 $\epsilon > 0.1$ 时准确率随 $\epsilon$ 增大而降低。
  • 有目标FGSM的攻击成功率随迭代次数增加而提高,在CIFAR-10上,当 $\epsilon = 0.02$ 且迭代10次时,成功率超过90%。
  • 当 $\epsilon \leq 0.015$ 时,有目标FGSM的成功率随 $\epsilon$ 增大而上升,但超过该阈值后急剧下降,表明存在最优扰动范围。
  • CW-L2攻击成功将1000张猫图片中的750张误分类为狗,使概率质量从类别4(猫)转移到类别6(狗)。
  • 将猫图片误分类为类别9的概率从0.0048降至0.004,证实模型对目标类别的置信度提高。
  • 数值结果证实,CW-L2攻击提高了目标类与真实类之间分类概率的比值,与理论分析预测一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。