[论文解读] Enhancing Cross-task Transferability of Adversarial Examples with Dispersion Reduction
本文提出了一种名为分散性降低(Dispersion Reduction, DR)的新型对抗性攻击方法,通过最小化卷积层中内部特征图的分散性,提升跨任务的迁移能力。通过针对各类视觉模型共有的低级特征进行攻击,DR 在仅使用 $l_∞ \leq 16$ 扰动的情况下,成功在多个真实世界计算机视觉 API 中实现最先进的逃逸效果——在 SafeSearch 上使准确率下降高达 77%,在文本识别任务上下降达 95.9%。
Neural networks are known to be vulnerable to carefully crafted adversarial examples, and these malicious samples often transfer, i.e., they maintain their effectiveness even against other models. With great efforts delved into the transferability of adversarial examples, surprisingly, less attention has been paid to its impact on real-world deep learning deployment. In this paper, we investigate the transferability of adversarial examples across a wide range of real-world computer vision tasks, including image classification, explicit content detection, optical character recognition (OCR), and object detection. It represents the cybercriminal's situation where an ensemble of different detection mechanisms need to be evaded all at once. We propose practical attack that overcomes existing attacks' limitation of requiring task-specific loss functions by targeting on the `dispersion' of internal feature map. We report evaluation on four different computer vision tasks provided by Google Cloud Vision APIs to show how our approach outperforms existing attacks by degrading performance of multiple CV tasks by a large margin with only modest perturbations.
研究动机与目标
- 为解决在多样化、真实世界计算机视觉任务中对抗性迁移能力的不足,特别是在安全关键应用中使用的集成检测系统中的问题。
- 开发一种不依赖于任务特定损失函数的攻击方法,从而实现对分类、目标检测、OCR 和敏感内容检测等各类任务的广泛适用性。
- 在商业部署的黑盒视觉 API 上评估所提方法的有效性,模拟真实网络犯罪分子的逃逸场景。
- 为评估基于深度学习的检测系统对可迁移对抗样本的鲁棒性提供一个基准。
提出的方法
- DR 攻击通过将特定中间卷积层(如 VGG-16 中的 conv3.3)的特征图分散性最小化,利用分散性作为潜在空间中特征对比度的代理指标。
- 分散性计算为给定层中各特征图激活值的方差,通过使用固定超参数($\beta_1=0.98$, $\beta_2=0.99$, $\text{lr}=5\times10^{-2}$)的 Adam 优化器进行最小化。
- 该攻击端到端应用于源模型(如 VGG-16 或 ResNet-152),生成对抗性样本后在黑盒 Google Cloud Vision API 上进行测试。
- 该方法避免依赖于任务特定损失函数(如交叉熵),从而实现向无关任务(如 OCR 和目标检测)的迁移。
- 扰动被限制在 $l_\infty \leq 16$ 范围内,以确保不可察觉性的同时最大化迁移能力。
- 该方法基于假设:低级特征(由浅层检测)在各类视觉模型中高度相似,因此分散性降低可作为一种通用的失真机制。
实验结果
研究问题
- RQ1能否设计一种对抗性攻击,使其在不依赖任务特定损失函数的前提下,有效跨多样化、真实世界计算机视觉任务实现迁移?
- RQ2降低特征图分散性如何影响对抗性样本在黑盒、商业视觉 API 上的迁移能力?
- RQ3在多任务逃逸场景中,分散性降低方法相较于现有提升迁移能力的攻击方法(如 MI-FGSM、DIM)在多大程度上表现更优?
- RQ4该攻击的有效性是否与不同视觉模型之间低级特征的相似性相关?
主要发现
- DR 攻击使 Google Cloud Vision 的 Labels 和 SafeSearch 模型准确率分别降低至 23% 和 35%,在逃避 SafeSearch 方面优于 MI-FGSM(38%)和 DIM(43%)。
- 在目标检测任务中,DR 使 mAP 降低至 32.9%,显著低于 MI-FGSM 的 43.2% 和 DIM 的 44.1%。
- 在文本识别任务中,DR 仅使 4.1% 的单词被正确识别(C.R.W.),远低于 MI-FGSM 的 12.3% 和 DIM 的 14.5%,展现出更优的迁移能力。
- 该攻击保持了与原始图像的高度视觉相似性,扰动幅度为 $l_\infty \leq 16$,确认了其不可察觉性。
- 当在相同源模型上测试时,DR 攻击在分类、目标检测、敏感内容检测和 OCR 四项任务中均表现出一致的优越性。
- 结果验证了该假设:在早期卷积层中降低分散性可引发普遍性失真,从而在多种视觉模型上导致性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。