[论文解读] DeepSearch: A Simple and Effective Blackbox Attack for Deep Neural Networks
DeepSearch 是一种针对深度神经网络的查询高效、黑盒对抗攻击方法,通过反馈引导的模糊测试和迭代优化,生成具有低 $L_{\infty}$ 扰动的细微对抗样本。它在 SVHN、CIFAR-10 和 ImageNet 上的攻击成功率和查询效率均优于当前最先进的黑盒攻击方法,即使面对经过对抗训练防御的模型也表现优异。
Although deep neural networks have been very successful in image-classification tasks, they are prone to adversarial attacks. To generate adversarial inputs, there has emerged a wide variety of techniques, such as black- and whitebox attacks for neural networks. In this paper, we present DeepSearch, a novel fuzzing-based, query-efficient, blackbox attack for image classifiers. Despite its simplicity, DeepSearch is shown to be more effective in finding adversarial inputs than state-of-the-art blackbox approaches. DeepSearch is additionally able to generate the most subtle adversarial inputs in comparison to these approaches.
研究动机与目标
- 开发一种在有限查询预算下运行的查询高效黑盒攻击方法,用于深度神经网络。
- 通过利用网络预测输出的反馈信息,引导模糊测试以提高攻击成功率。
- 通过迭代优化过程降低对抗样本的扰动幅度。
- 将分层分组方法应用于黑盒环境,以最小化查询次数。
- 评估该方法在标准模型和经过对抗训练防御模型上的有效性。
提出的方法
- DeepSearch 从一个被正确分类的图像出发,通过反馈引导的像素变异,高效逼近决策边界。
- 它采用一种反馈机制,根据模型输出分数优先选择可能导致误分类的扰动。
- 该攻击方法利用分层分组技术,同时模糊多个图像维度,显著减少查询次数。
- 在找到对抗样本后,应用迭代优化以最小化 $L_{\infty}$ 扰动,同时保持误分类状态。
- 该方法仅限于 $L_{\infty}$-有界扰动,并且仅查询模型以获取预测分数。
- 该方法专为黑盒环境设计,无需访问模型架构或参数。
实验结果
研究问题
- RQ1基于模糊测试的简单方法是否能在查询效率和成功率方面超越现有最先进的黑盒攻击?
- RQ2反馈引导的变异在最小化查询次数的前提下,引导搜索接近对抗样本的有效性如何?
- RQ3迭代优化在多大程度上可以降低对抗样本的扰动幅度?
- RQ4分层分组是否能显著减少黑盒攻击所需的查询次数?
- RQ5DeepSearch 在经过对抗训练加固的模型上的表现如何?
主要发现
- 在 SVHN、CIFAR-10 和 ImageNet 的查询受限设置下,DeepSearch 在所有评估的黑盒攻击方法中取得了最高的攻击成功率。
- 与当前最先进的方法相比,DeepSearch 生成的对抗样本具有显著更低的 $L_{\infty}$ 扰动,表明其隐蔽性更强。
- 迭代优化步骤在保持误分类的同时降低了对抗扰动的幅度,从而产生更具隐蔽性的攻击。
- 分层分组显著减少了查询次数,使 DeepSearch 比基于梯度估计和其他基于查询的方法更加高效。
- DeepSearch 能够成功攻击经过对抗训练防御的模型,表明其对常见防御手段具有鲁棒性。
- 即使在查询预算严重受限的情况下,该攻击仍保持高效,优于 Ilyas 等人(2018)、Guo 等人(2019)和 Moon 等人(2019)的方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。