[论文解读] A Little Robustness Goes a Long Way: Leveraging Robust Features for Targeted Transfer Attacks
本文表明,训练源分类器使其对小规模对抗扰动仅具备轻微鲁棒性,可显著提升针对不同架构(包括卷积神经网络和视觉变换器)的定向对抗攻击的迁移能力。关键洞见在于,轻微鲁棒模型学习到的特征与非鲁棒模型对齐,从而实现高度有效的黑盒定向攻击。
Adversarial examples for neural network image classifiers are known to be transferable: examples optimized to be misclassified by a source classifier are often misclassified as well by classifiers with different architectures. However, targeted adversarial examples -- optimized to be classified as a chosen target class -- tend to be less transferable between architectures. While prior research on constructing transferable targeted attacks has focused on improving the optimization procedure, in this work we examine the role of the source classifier. Here, we show that training the source classifier to be "slightly robust" -- that is, robust to small-magnitude adversarial examples -- substantially improves the transferability of class-targeted and representation-targeted adversarial attacks, even between architectures as different as convolutional neural networks and transformers. The results we present provide insight into the nature of adversarial examples as well as the mechanisms underlying so-called "robust" classifiers.
研究动机与目标
- 探究源分类器的鲁棒性是否影响定向对抗样本的迁移能力。
- 理解为何定向对抗样本相较于非定向样本在不同架构间的迁移能力更低。
- 探究轻微鲁棒模型是否学习到与非鲁棒模型重叠的特征,从而实现更广泛的攻击成功率。
- 评估对抗损失函数与网络架构在对抗迁移能力中的作用。
- 考察鲁棒与非鲁棒网络之间特征重叠对迁移学习与模型可解释性的影响。
提出的方法
- 通过使用FGSM或PGD进行标准对抗训练,在小扰动范围(ε = 2–4)内训练源分类器,使其具备‘轻微鲁棒’行为。
- 通过针对特定误分类目标的优化,利用轻微鲁棒的源网络生成定向对抗样本。
- 通过将相同对抗样本应用于具有不同架构(如ResNets、ViT、CLIP)的黑盒目标网络,评估迁移能力。
- 通过测量在包括视觉变换器和CLIP在内的多种架构上的定向攻击成功率,量化迁移能力。
- 对比不同鲁棒性水平的源网络(非鲁棒、轻微鲁棒、高度鲁棒)的迁移能力,以隔离鲁棒性的影响。
- 使用表示目标攻击评估源网络与目标网络之间的特征相似性,测量对抗扰动在特征空间中的迁移效果。
实验结果
研究问题
- RQ1将源分类器训练为轻微鲁棒是否能显著提升其生成的定向对抗样本向其他架构的迁移能力?
- RQ2源网络的鲁棒性水平如何影响其在非鲁棒模型与对抗防御模型上的定向迁移攻击成功率?
- RQ3即使非鲁棒模型采用不同目标函数或架构,轻微鲁棒网络是否仍能学习到与之重叠的特征?
- RQ4从轻微鲁棒模型生成的表示目标对抗攻击是否能有效迁移到包括视觉变换器在内的多样化目标网络?
- RQ5在使用轻微鲁棒源模型时,对抗损失函数在生成可迁移定向样本中起到何种作用?
主要发现
- 从轻微鲁棒CNN生成的对抗样本在向其他CNN迁移方面表现优异,且出人意料地可高效迁移到视觉变换器架构(如ViT、LeViT、CCT)。
- 与非鲁棒或高度鲁棒模型相比,当源网络具备轻微鲁棒性时,定向对抗样本的迁移能力显著提升。
- 轻微鲁棒网络在表示目标对抗攻击中表现出强大的迁移能力,表明其与非鲁棒模型存在显著的特征重叠。
- 非鲁棒网络之间未表现出显著的特征迁移能力,表明其学习到的特征未保持一致对齐。
- 该方法首次实现了针对基于视觉变换器的模型(如ViT和CLIP)的定向迁移攻击,证明了其在广泛架构上的适用性。
- 该攻击的成功不局限于架构或目标函数相似的模型——即使从ResNet源模型攻击CLIP(其预训练目标不同),迁移依然有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。