Skip to main content
QUICK REVIEW

[论文解读] Pre-trained Adversarial Perturbations

Yuanhao Ban, Yinpeng Dong|arXiv (Cornell University)|Oct 7, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出了一种新型的通用对抗性攻击方法——预训练对抗扰动(PAPs),针对的是在微调前的预训练视觉模型。通过利用一种低层级层提升攻击(L4A),该方法操纵模型早期层的激活,并结合均匀高斯噪声增强以提升迁移能力,PAPs在十项下游任务中对微调后的模型实现了高达95.3%的攻击成功率,显著优于准黑盒设置下的最先进方法。

ABSTRACT

Self-supervised pre-training has drawn increasing attention in recent years due to its superior performance on numerous downstream tasks after fine-tuning. However, it is well-known that deep learning models lack the robustness to adversarial examples, which can also invoke security issues to pre-trained models, despite being less explored. In this paper, we delve into the robustness of pre-trained models by introducing Pre-trained Adversarial Perturbations (PAPs), which are universal perturbations crafted for the pre-trained models to maintain the effectiveness when attacking fine-tuned ones without any knowledge of the downstream tasks. To this end, we propose a Low-Level Layer Lifting Attack (L4A) method to generate effective PAPs by lifting the neuron activations of low-level layers of the pre-trained models. Equipped with an enhanced noise augmentation strategy, L4A is effective at generating more transferable PAPs against fine-tuned models. Extensive experiments on typical pre-trained vision models and ten downstream tasks demonstrate that our method improves the attack success rate by a large margin compared with state-of-the-art methods.

研究动机与目标

  • 研究预训练模型在微调后仍具有效性的对抗性攻击的脆弱性。
  • 填补从预训练到微调流程中对抗鲁棒性评估的空白。
  • 开发一种在下游任务细节未知的准黑盒设置下有效的通用对抗攻击方法。
  • 通过聚焦于低层级特征表示,提升对抗扰动在微调过程中的迁移能力。

提出的方法

  • 提出一种低层级层提升攻击(L4A),针对预训练模型早期层的神经元激活进行操纵。
  • 利用观察结果:低层级特征在微调过程中变化较小,因而能更好地保持攻击的有效性。
  • 引入一种基于均匀高斯采样的噪声增强策略,以提升PAPs的迁移能力。
  • 通过优化扰动以最大化误分类率,同时最小化对低层级特征的影响,生成PAPs。
  • 采用一种强调低层级层激活的损失函数,以指导扰动生成。
  • 在所有模型上使用单一超参数配置(μl=0.4, μh=0.6, σl=0.05, σh=0.1),以保持一致性与泛化能力。

实验结果

研究问题

  • RQ1为预训练模型生成的对抗扰动是否能在微调后仍保持对下游模型的高迁移能力?
  • RQ2为何预训练模型的低层级特征在从预训练到微调的流程中更适合作为通用对抗攻击的目标?
  • RQ3噪声增强如何提升通用对抗扰动在微调过程中的迁移能力?
  • RQ4在该背景下,引入高层层损失在多大程度上会降低通用对抗攻击方法的性能?
  • RQ5所提出的L4A方法在多样化的下游任务中,与现有通用攻击基线相比,其攻击成功率如何?

主要发现

  • 在基础L4A配置下,L4A方法在ResNet101上的平均攻击成功率达71.90%,在ResNet50上为72.64%,在ViT-Base-16上为94.42%。
  • 加入噪声增强(L4A ugs)后,攻击成功率分别提升至ResNet101的72.20%、ResNet50的77.80%以及ViT-Base-16的95.30%,表现出显著改进。
  • 该方法在所有三种预训练模型及十项下游任务中均优于所有基线方法,包括EPGD、UAP和ASV。
  • 像素级扰动(ε=0.05)的平均攻击成功率仅为12.52%,表明标准扰动在此情境下无效。
  • 高层层损失显著降低性能,导致攻击成功率下降超过10%,证实聚焦于低层级特征至关重要。
  • 超参数配置(μl=0.4, μh=0.6, σl=0.05, σh=0.1)在无需重新调优的情况下可在多种模型上良好泛化,确保性能一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。