[论文解读] Transferable Sparse Adversarial Attack
该论文提出了一种基于生成器的框架,用于在ℓ₀范数约束下生成可迁移的稀疏对抗攻击。通过将扰动解耦为振幅和位置两部分,并使用可学习的0-1量化操作符,该方法在保持极低扰动水平的同时,显著提升了迁移能力,且推理速度比当前最先进方法快700倍,在ImageNet上于相近稀疏度水平下,对抗迁移能力相比GreedyFool最高提升50%。
Deep neural networks have shown their vulnerability to adversarial attacks. In this paper, we focus on sparse adversarial attack based on the $\ell_0$ norm constraint, which can succeed by only modifying a few pixels of an image. Despite a high attack success rate, prior sparse attack methods achieve a low transferability under the black-box protocol due to overfitting the target model. Therefore, we introduce a generator architecture to alleviate the overfitting issue and thus efficiently craft transferable sparse adversarial examples. Specifically, the generator decouples the sparse perturbation into amplitude and position components. We carefully design a random quantization operator to optimize these two components jointly in an end-to-end way. The experiment shows that our method has improved the transferability by a large margin under a similar sparsity setting compared with state-of-the-art methods. Moreover, our method achieves superior inference speed, 700$ imes$ faster than other optimization-based methods. The code is available at https://github.com/shaguopohuaizhe/TSAA.
研究动机与目标
- 解决现有ℓ₀稀疏对抗攻击在黑盒设置下迁移能力低下的问题。
- 通过在多样化数据上训练生成器而非对每张图像单独优化,减少对目标模型的过拟合。
- 通过新型可微量化操作符,实现稀疏对抗样本的端到端训练。
- 在保持极小扰动的同时实现高攻击成功率,并维持快速推理速度。
- 证明稀疏对抗样本在真实世界应用中既具备可迁移性又具备高效性。
提出的方法
- 该方法使用一个生成器,将对抗扰动解耦为振幅和位置两部分,分别建模为独立的可学习映射。
- 引入随机量化操作符,通过二值化位置图(0或1)来强制实现稀疏性,从而在离散优化背景下实现端到端训练。
- 生成器通过对抗损失、位置图上的稀疏正则化以及量化损失联合训练,以保持训练与推理阶段的一致性。
- 该框架在推理阶段避免反向传播,实现一次前向传播即可生成对抗样本。
- 模型在ImageNet数据上进行训练,以提升对多样化图像的泛化能力,减少对任一特定目标模型的过拟合。
- 该方法支持ℓ₀稀疏性与ℓ∞范数约束,可在真实约束条件下评估鲁棒性。
实验结果
研究问题
- RQ1能否使ℓ₀稀疏对抗样本在不同深度神经网络架构之间具备高度可迁移性?
- RQ2与逐图像优化相比,在大规模数据集上训练生成器是否能有效减少对目标模型的过拟合?
- RQ3可微的0-1量化操作符能否有效支持稀疏扰动的端到端训练?
- RQ4振幅与位置分量的解耦如何提升稀疏对抗样本的质量与可迁移性?
- RQ5在ℓ₀对抗攻击中,稀疏性、攻击成功率与推理速度之间存在何种权衡?
主要发现
- 在仅0.46%像素扰动下,该方法从InceptionV3到ResNet50的迁移能力达到63.76%,显著优于GreedyFool在0.67%稀疏度下的15.09%。
- 在ℓ∞ ≤ 10约束下,该方法实现45.32%的迁移能力,稀疏度为14.47%,而GreedyFool在18.19%稀疏度下仅达10.67%。
- 该方法比基于优化的方法快700倍,平均每个对抗样本仅需6ms,而GreedyFool需20.49s。
- 消融实验表明,解耦机制与所提出的量化操作符至关重要:移除任一组件会使迁移能力下降高达40%。
- 训练于大规模数据集可提升迁移能力,如‘ad-hoc’消融实验所示:逐图像训练的模型迁移能力为43.97%,而本方法达63.76%。
- 该方法在白盒攻击中保持高成功率(InceptionV3上为61.24%),同时在黑盒迁移能力上显著优于基线方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。