[论文解读] Scratch that! An Evolution-based Adversarial Attack against Neural Networks
本文提出对抗性划痕——通过进化策略演化生成的、基于几何形状(直线或贝塞尔曲线)的局部化参数扰动,在仅修改极小部分像素的受限黑盒威胁模型下,实现攻击。该攻击在 ImageNet 上实现 98.77% 的目标攻击成功率,在 CIFAR-10 上实现 97.20%,且像素修改量低于 5%,并成功欺骗了微软认知服务图像字幕生成 API,证明了其在现实世界中的可行性。
We study black-box adversarial attacks for image classifiers in a constrained threat model, where adversaries can only modify a small fraction of pixels in the form of scratches on an image. We show that it is possible for adversaries to generate localized extit{adversarial scratches} that cover less than $5\%$ of the pixels in an image and achieve targeted success rates of $98.77\%$ and $97.20\%$ on ImageNet and CIFAR-10 trained ResNet-50 models, respectively. We demonstrate that our scratches are effective under diverse shapes, such as straight lines or parabolic B\a'ezier curves, with single or multiple colors. In an extreme condition, in which our scratches are a single color, we obtain a targeted attack success rate of $66\%$ on CIFAR-10 with an order of magnitude fewer queries than comparable attacks. We successfully launch our attack against Microsoft's Cognitive Services Image Captioning API and propose various mitigation strategies.
研究动机与目标
- 开发一种能模拟图像上物理划痕的现实黑盒对抗攻击,受限于仅修改极小部分像素。
- 评估对抗性划痕在不同形状、颜色和位置下的有效性,包括单色和单划痕场景。
- 通过成功攻击微软认知服务图像字幕生成 API,证明其在现实世界中的适用性。
- 提出并评估实用的防御机制,包括 JPEG 压缩、中值滤波和像素截断。
提出的方法
- 对抗性划痕通过协方差矩阵自适应进化策略(CMA-ES)进行参数化演化,参数包括划痕数量、形状(直线或贝塞尔曲线)、位置和颜色。
- 适应度函数基于目标类别预测的模型置信度分数,支持仅通过查询模型输出结果的黑盒优化。
- 攻击在严格查询预算下运行,以模拟现实世界 API 中的速率限制,确保实用性。
- 划痕生成在图像域(像素范围 [0,1] 内)和网络域(无约束)中分别进行,以扩展攻击面评估范围。
- 通过良性图像上的恢复率和模型准确率下降来评估防御措施,包括 JPEG 压缩、中值滤波和像素截断。
- 该方法在 CIFAR-10 和 ImageNet 上应用于 ResNet-50、VGG-19 和 AlexNet,并对形状、颜色和位置进行了消融研究。
实验结果
研究问题
- RQ1在黑盒、低查询量和低像素修改量的威胁模型下,对抗性划痕——即局部化几何扰动——能否实现高目标攻击成功率?
- RQ2当对抗性划痕被限制为单色或单条划痕时,其有效性如何?这是否影响查询效率?
- RQ3对抗性划痕能否成功绕过现实世界商业 API,如微软认知服务图像字幕生成 API?
- RQ4哪些防御机制(如 JPEG 压缩、中值滤波)最能有效缓解对抗性划痕,同时保持良性模型性能?
- RQ5源类别与目标类别之间的语义相似性与对抗性划痕的成功率之间是否存在相关性?
主要发现
- 该攻击在 ImageNet 上实现 98.77% 的目标攻击成功率,在 CIFAR-10 上实现 97.20%,且仅修改了少于 5% 的像素。
- 在极端的单色、单划痕场景下,该攻击在 CIFAR-10 上实现了 66% 的目标攻击成功率,且查询次数比同类方法少一个数量级。
- 该攻击成功欺骗了微软认知服务图像字幕生成 API,导致生成错误或无字幕,证明了其在现实世界中的可利用性。
- 在 CIFAR-10 网络域攻击中,质量为 99 的 JPEG 压缩实现了最高的恢复率(82%),且在良性图像上仅造成 0.19% 的准确率下降。
- 中值滤波在图像域攻击中防御效果最佳(81% 恢复率),但在 CIFAR-10 上导致 13.91% 的准确率下降,表明鲁棒性与性能之间存在权衡。
- 将像素截断至 [0,1] 范围对图像域攻击无效(0% 恢复率),但在网络域中实现了 70% 的恢复率,凸显了防御效果的域依赖性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。