[论文解读] Closer Look at the Transferability of Adversarial Examples: How They Fool Different Models Differently
本文通过分析为何不同模型会将同一对抗性样本误分类为相同或不同的错误类别,研究了对抗性样本在类别感知下的可迁移性。作者提出,非鲁棒特征——即对人类不可见但对模型具有预测性的模式——可同时解释相同错误与不同错误,而模型对这些特征的特异性使用导致即使在相似模型中也会产生不同的预测结果。
Deep neural networks are vulnerable to adversarial examples (AEs), which have adversarial transferability: AEs generated for the source model can mislead another (target) model's predictions. However, the transferability has not been understood in terms of to which class target model's predictions were misled (i.e., class-aware transferability). In this paper, we differentiate the cases in which a target model predicts the same wrong class as the source model ("same mistake") or a different wrong class ("different mistake") to analyze and provide an explanation of the mechanism. We find that (1) AEs tend to cause same mistakes, which correlates with "non-targeted transferability"; however, (2) different mistakes occur even between similar models, regardless of the perturbation size. Furthermore, we present evidence that the difference between same mistakes and different mistakes can be explained by non-robust features, predictive but human-uninterpretable patterns: different mistakes occur when non-robust features in AEs are used differently by models. Non-robust features can thus provide consistent explanations for the class-aware transferability of AEs.
研究动机与目标
- 理解对抗性样本在类别感知下的可迁移性机制,区分相同与不同误分类错误。
- 研究为何对抗性样本会导致不同模型尽管架构相似或扰动大小相近,仍误分类为不同的错误类别。
- 检验非鲁棒特征——人类不可见但对模型具有预测性的模式——是否能解释相同与不同错误。
- 评估模型对非鲁棒特征的特异性依赖如何影响可迁移性结果,特别是在黑箱攻击场景中。
- 测试基于集成的攻击是否通过聚焦共享的非鲁棒特征,减少不同错误的发生。
提出的方法
- 作者分析了在CIFAR-10上使用ResNet-18和VGG-16模型生成的PGD攻击所产生的对抗性样本,将可迁移性分类为相同错误(目标模型误分类为与源模型相同的类别)和不同错误(目标模型误分类为不同的错误类别)。
- 他们通过将对抗性样本重新标记为预测类别,构建了非鲁棒训练集,随后在这些数据集上训练模型,以验证模型是否能学习到与多个类别相关的非鲁棒特征。
- 在相同架构和初始权重下,对打乱顺序的训练集进行训练,以隔离随机性对非鲁棒特征学习和误分类模式的影响。
- 他们比较了在单个模型(Vanilla)与集成模型(Ensemble)上进行的定向对抗性攻击,以评估共享非鲁棒特征是否能减少不同错误。
- 他们使用l2有界扰动(ε=1.0)和10步定向PGD,对5,000张图像量化可迁移性结果,测量未被欺骗、相同错误和不同错误的情况。
- 通过展示在非鲁棒数据集上训练的模型在重标记数据上的测试准确率高于随机水平(10%),验证了假设,确认对抗性样本中存在与多类别相关的非鲁棒特征。
实验结果
研究问题
- RQ1哪些因素影响对抗性样本导致目标模型与源模型产生相同错误或不同错误?
- RQ2模型相似性在对抗性可迁移性中导致不同错误发生的程度如何?
- RQ3增大扰动大小是否会降低不同错误的比例,还是该现象在不同大小下均持续存在?
- RQ4非鲁棒特征——人类不可见但具有预测性的模式——是否能解释相同与不同误分类结果?
- RQ5基于集成的对抗性攻击是否能通过聚焦共享的非鲁棒特征,减少不同错误的发生频率?
主要发现
- 对抗性样本倾向于导致相同错误,且与非定向可迁移性密切相关,表明模型通常会将样本误分类为相同的错误类别。
- 即使在高度相似的模型之间(如相同架构、相同初始权重),也会发生不同错误,表明模型对特征的特异性使用是导致误分类分歧的根本原因。
- 更大的扰动会增加相同错误的可能性,但不会降低不同错误的比例,表明根本原因超出了扰动大小的范畴。
- 在非鲁棒数据集上训练的模型在重标记数据上的测试准确率高于随机水平(10%),确认对抗性样本中存在与多类别相关的非鲁棒特征。
- 当模型在相同的非鲁棒数据集上训练,但采用不同的随机打乱或Dropout设置时,会学习到不同的非鲁棒特征,这解释了即使在相同架构下也会出现不同错误。
- 在定向攻击中使用集成模型可减少不同错误(从250例降至216例),并增加相同错误(从426例增至842例),证实共享非鲁棒特征能提升可迁移性的一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。