[论文解读] An Empirical Evaluation of Adversarial Robustness under Transfer Learning
该论文评估了从在 CIFAR-100 上训练的 ResNet56 到 CIFAR-10 上的目标网络的对抗鲁棒性迁移,采用 FGSM 和 PGD 对抗训练方法。结果表明,基于 PGD 的鲁棒特征比 FGSM 的迁移效果更优,在使用鲁棒权重初始化和目标网络对对抗训练后,对白盒 PGD 攻击的准确率提高了 5.2%,凸显了迭代鲁棒优化在可迁移防御中的重要性。
In this work, we evaluate adversarial robustness in the context of transfer learning from a source trained on CIFAR 100 to a target network trained on CIFAR 10. Specifically, we study the effects of using robust optimisation in the source and target networks. This allows us to identify transfer learning strategies under which adversarial defences are successfully retained, in addition to revealing potential vulnerabilities. We study the extent to which features learnt by a fast gradient sign method (FGSM) and its iterative alternative (PGD) can preserve their defence properties against black and white-box attacks under three different transfer learning strategies. We find that using PGD examples during training on the source task leads to more general robust features that are easier to transfer. Furthermore, under successful transfer, it achieves 5.2% more accuracy against white-box PGD attacks than suitable baselines. Overall, our empirical evaluations give insights on how well adversarial robustness under transfer learning can generalise.
研究动机与目标
- 研究在 CIFAR-100 上训练的源模型的对抗鲁棒性如何迁移到 CIFAR-10 上的目标模型。
- 评估通过对抗训练学习到的鲁棒特征在迁移学习下是否能在不同任务间泛化。
- 识别在黑盒和白盒对抗攻击下能保持或增强鲁棒性的迁移学习策略。
- 评估在目标网络上使用鲁棒权重初始化和对抗训练对防御泛化性能的影响。
提出的方法
- 采用三种策略将知识从在 CIFAR-100 上训练的 ResNet56 迁移到 CIFAR-10 上的目标网络:仅冻结最后一层、仅解冻最后一层块,或微调整个网络。
- 使用两种威胁模型评估对抗鲁棒性:快速梯度符号法(FGSM)和投影梯度下降(PGD),其中 PGD 用作迭代攻击以实现鲁棒优化。
- 在源网络和目标网络的训练过程中通过引入 FGSM 和 PGD 生成的对抗样本,实施鲁棒优化。
- 在黑盒和白盒攻击设置下,通过干净准确率和对抗准确率评估不同训练与迁移组合的性能。
- 消融研究比较了在源和目标网络上使用自然(nat)或对抗(adv)优化训练的模型,采用如 R_adv→adv 的命名约定表示源和目标的训练方法。
- 通过归一化的热力图和全面的准确率表格进行结果可视化,关键比较聚焦于鲁棒性迁移与干净准确率之间的权衡。
实验结果
研究问题
- RQ1通过 FGSM 或 PGD 学习到的对抗鲁棒性是否能有效从在 CIFAR-100 上训练的源模型迁移到在 CIFAR-10 上的目标模型?
- RQ2对抗训练方法的选择(FGSM 与 PGD)如何影响鲁棒特征的可迁移性?
- RQ3鲁棒权重初始化是否能提升目标任务上的防御性能,尤其是在白盒攻击下?
- RQ4不同迁移学习策略(如微调与特征提取)对鲁棒性和干净准确率有何影响?
- RQ5低层级特征在多大程度上促进鲁棒性迁移?与依赖高层级、分类特征的防御相比,其表现如何?
主要发现
- 在源网络上使用基于 PGD 的对抗训练可产生更具泛化能力的鲁棒特征,其在目标网络上的迁移效果优于基于 FGSM 的防御。
- 在源任务训练期间使用 PGD 生成的对抗样本,使目标网络在白盒 PGD 攻击下的准确率相比基线提高了 5.2%。
- 结合鲁棒权重初始化与目标网络上的对抗训练,能显著提升对白盒攻击的鲁棒性,在所评估设置中达到最先进性能。
- 仅依赖低层级特征的防御对黑盒攻击具有足够的鲁棒性,且其迁移一致性优于依赖高层级、分类特征的防御。
- 仅微调网络最后一层块在性能与训练效率之间提供了良好平衡,在计算成本较低的情况下实现了接近基线的鲁棒性。
- 在鲁棒初始化后,若在目标网络上使用非迭代方法(如 FGSM)进行对抗训练,性能反而更差,表明构建鲁棒防御需要像 PGD 这类迭代攻击。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。