[论文解读] Enhancing Gradient-based Attacks with Symbolic Intervals
本文提出区间攻击(interval attacks),一种新颖的基于梯度的方法,通过利用符号区间传播来识别输入周围更广泛、更具前景的区域,从而提升对抗样本搜索效果。通过使用精确的上界近似来生成更具信息量的梯度,该方法在最先进的对抗训练模型上实现的对抗攻击成功率比PGD高出47%,包括MadryLab挑战赛中表现最佳的MNIST模型。
Recent breakthroughs in defenses against adversarial examples, like adversarial training, make the neural networks robust against various classes of attackers (e.g., first-order gradient-based attacks). However, it is an open question whether the adversarially trained networks are truly robust under unknown attacks. In this paper, we present interval attacks, a new technique to find adversarial examples to evaluate the robustness of neural networks. Interval attacks leverage symbolic interval propagation, a bound propagation technique that can exploit a broader view around the current input to locate promising areas containing adversarial instances, which in turn can be searched with existing gradient-guided attacks. We can obtain such a broader view using sound bound propagation methods to track and over-approximate the errors of the network within given input ranges. Our results show that, on state-of-the-art adversarially trained networks, interval attack can find on average 47% relatively more violations than the state-of-the-art gradient-guided PGD attack.
研究动机与目标
- 为解决基于梯度的攻击在搜索鲁棒神经网络中的对抗样本时容易陷入局部最优的问题。
- 探究对抗训练模型是否真的能抵御未知攻击,尤其是在标准的一阶攻击(如PGD)无法找到所有对抗样本的情况下。
- 开发一种通用攻击框架,结合精确的边界传播与现有基于梯度的攻击方法,以探索更广阔的搜索空间。
- 评估区间攻击在最先进的对抗训练模型上的有效性,包括MadryLab MNIST挑战赛中的模型。
提出的方法
- 该方法使用符号区间分析——一种精确的边界传播技术——来对给定输入扰动区域上神经网络的输出范围进行上界近似。
- 它从符号区间表示中提取区间梯度,该梯度比标准梯度提供了更广阔的损失景观视图。
- 区间梯度引导搜索朝向更具对抗性潜力的区域,避免标准PGD陷入的局部极小值。
- 该攻击采用两阶段过程:首先,使用区间梯度识别有希望的起始点;其次,应用强效的基于梯度的攻击(如PGD)来优化并精确定位对抗样本。
- 采用动态范围调整策略,在迭代过程中平衡上界近似误差与搜索效率。
- 该框架具有通用性,可适配于符号区间之外的其他精确边界传播方法。
实验结果
研究问题
- RQ1区间攻击是否能在对抗训练模型上比标准的基于梯度的攻击(如PGD)更有效地找到对抗样本?
- RQ2符号区间传播是否能提供更广泛、更具信息量的梯度,从而帮助在对抗搜索中逃离局部最优?
- RQ3区间攻击在最鲁棒的模型(如MadryLab MNIST挑战赛中的模型)上的有效性如何?
- RQ4区间攻击是否能揭示此前未被发现的、被宣称具有鲁棒性的模型中的漏洞?
- RQ5与PGD相比,使用区间攻击进行对抗训练的计算成本和收敛行为如何?
主要发现
- 在三个对抗训练的MNIST模型上,区间攻击平均比PGD多找到47%的对抗样本。
- 在MadryLab MNIST挑战赛模型——迄今为止MNIST上最鲁棒的模型——上,区间攻击在所有现有攻击中取得了最高的成功率。
- 区间攻击的损失分布显示出大量显著且高价值的违规情况,而PGD和CW攻击则集中于低损失、易被发现的样本。
- 在MNIST_FC1和MNIST_FC2上,仅使用20次迭代,区间攻击相比PGD的攻击成功率相对提升了38%至61%。
- 使用区间攻击进行对抗训练显著慢于基于PGD的训练,使一个小规模MNIST网络达到80%鲁棒准确率所需时间是PGD的47倍。
- 结果表明,PGD并非终极的一阶攻击方法,精确的边界传播可显著提升对抗搜索效果,揭示隐藏的对抗区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。