[论文解读] Attacking deep networks with surrogate-based adversarial black-box methods is easy
该论文提出GFCS,一种简单但极为高效的黑箱对抗攻击方法,通过利用替代模型到目标网络的梯度迁移实现攻击。通过使用替代模型的梯度方向进行优化,并在需要时回退到共像采样,GFCS在使用ResNet-152作为替代模型时,对ImageNet上的VGG-16实现了99.9%的成功率,中位查询次数仅为6次。
A recent line of work on black-box adversarial attacks has revived the use of transfer from surrogate models by integrating it into query-based search. However, we find that existing approaches of this type underperform their potential, and can be overly complicated besides. Here, we provide a short and simple algorithm which achieves state-of-the-art results through a search which uses the surrogate network's class-score gradients, with no need for other priors or heuristics. The guiding assumption of the algorithm is that the studied networks are in a fundamental sense learning similar functions, and that a transfer attack from one to the other should thus be fairly "easy". This assumption is validated by the extremely low query counts and failure rates achieved: e.g. an untargeted attack on a VGG-16 ImageNet network using a ResNet-152 as the surrogate yields a median query count of 6 at a success rate of 99.9%. Code is available at https://github.com/fiveai/GFCS.
研究动机与目标
- 解决现有基于替代模型的黑箱攻击方法效率低下且复杂的问题。
- 探究是否可将替代模型的梯度迁移作为最小查询量下成功实现黑箱攻击的主要驱动力。
- 开发一种极简但极为有效的算法,在相同评估条件下超越当前最先进方法。
- 验证深度网络学习到相似特征表示的假设,从而实现跨架构的高保真梯度迁移。
提出的方法
- 该方法在基于梯度的优化过程中,将替代模型的梯度方向作为主要搜索方向。
- 采用固定步长ε的简单线性搜索,迭代地扰动输入图像。
- 当梯度迁移失败时,回退到共像采样——一种通过从替代模型的特征空间中采样生成替代搜索方向的方法。
- 该算法在使用替代模型梯度(q_sur)和共像生成方向(q_co)之间交替,以保持鲁棒性并避免陷入局部极小值。
- 该攻击为基于得分的攻击,需要访问目标模型的类别得分,从而在无需完整模型访问的情况下实现数值梯度估计。
- 该方法设计极为简洁:仅使用一个可调超参数(步长ε),无需额外先验、启发式规则或复杂优化策略。
实验结果
研究问题
- RQ1仅通过替代模型的简单梯度迁移,是否可在最小查询量下实现黑箱对抗攻击的最先进性能?
- RQ2在真实场景中,直接梯度迁移与更复杂的基于查询的优化策略相比,其有效性如何?
- RQ3不同深度网络在多大程度上共享相似的特征表示,从而支持高保真梯度迁移?
- RQ4当梯度迁移失败时,共像采样能否作为有效的备用机制以维持成功率?
- RQ5简单梯度迁移与最小启发式规则的结合是否足以超越更复杂、多阶段的攻击框架?
主要发现
- GFCS在使用ResNet-152作为替代模型时,对ImageNet上VGG-16的无目标攻击实现了99.9%的成功率,中位查询次数仅为6次。
- 在相同实验条件下,该方法优于所有对比的最先进方法,包括SimBA及其他基于查询的攻击方法。
- 攻击的成功主要由替代模型的直接梯度迁移驱动,而共像采样则在避免失败方面起到次要但关键的作用。
- 该算法在不同替代模型-目标模型组合下均表现出稳健性能,表明深度网络通常学习到相似的特征表示。
- 该方法的简洁性——仅需一个超参数(步长)且无需复杂先验——表明高性能并不依赖于算法复杂性。
- 即使在使用其他方法的默认超参数时,GFCS仍显著优于它们,尤其在超参数调优后(如SimBA-ODS中ε = 2.0)表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。