Skip to main content
QUICK REVIEW

[论文解读] Adversarial Token Attacks on Vision Transformers

Ameya Joshi, Gauri Jagatap|arXiv (Cornell University)|Oct 8, 2021
Adversarial Robustness in Machine Learning参考文献 51被引用 9
一句话总结

本文提出一种基于块稀疏、补丁的对抗性攻击方法,针对视觉变换器(ViTs),通过扰动特定图像补丁,揭示ViTs在令牌级别攻击下显著比ResNets更脆弱,仅使用1%的像素即可使鲁棒准确率降至接近零。该方法表明,在现实、稀疏且结构化的攻击下,ViTs的鲁棒性低于ResNets和MLP-Mixer,挑战了先前关于ViT在$ε$-有界攻击下具有鲁棒性的说法。

ABSTRACT

Vision transformers rely on a patch token based self attention mechanism, in contrast to convolutional networks. We investigate fundamental differences between these two families of models, by designing a block sparsity based adversarial token attack. We probe and analyze transformer as well as convolutional models with token attacks of varying patch sizes. We infer that transformer models are more sensitive to token attacks than convolutional models, with ResNets outperforming Transformer models by up to $\sim30\%$ in robust accuracy for single token attacks.

研究动机与目标

  • 研究视觉变换器(ViTs)及其他架构在令牌级别上的目标性、结构性扰动下的鲁棒性。
  • 通过设计一种模拟物理补丁攻击的实用、块稀疏攻击,弥补对现实世界对抗性威胁理解的空白。
  • 通过展示其自注意力机制对稀疏、局部令牌操作的敏感性,挑战先前关于ViT在$ε$-有界攻击下具有鲁棒性的说法。
  • 在相同令牌攻击条件下,比较ViT、DeIT、ResNets、WideResNet和MLP-Mixer在不同补丁尺寸和预算下的表现。

提出的方法

  • 提出一种块稀疏对抗性攻击,攻击者基于梯度幅值扰动非重叠图像补丁(令牌),以最大化误分类。
  • 施加令牌预算约束,限制可修改的补丁数量,以模拟稀疏、现实的攻击。
  • 使用基于梯度的显著性图识别最具有影响力的补丁进行扰动,确保攻击具有目标性和高效性。
  • 将攻击扩展至混合范数设置,每像素固定$ε$-有界$Ø∞$范数,以评估不可见性和鲁棒性。
  • 在多个架构上应用该攻击:ViT、DeIT、ResNet、WideResNet和MLP-Mixer,涵盖不同补丁尺寸和令牌预算。
  • 在稀疏(1×1像素)和块稀疏(16×16补丁)约束下评估鲁棒准确率,以比较攻击强度与现实性。

实验结果

研究问题

  • RQ1在现实威胁模型下,视觉变换器是否比卷积神经网络(如ResNets)更容易受到结构化、基于补丁的攻击?
  • RQ2在块稀疏攻击中,ViTs及其他架构的鲁棒性如何随补丁尺寸和令牌预算的增加而变化?
  • RQ3为何先前研究声称ViTs在$ε$-有界攻击下比ResNets更鲁棒?这一结论在令牌级别攻击下是否依然成立?
  • RQ4ViTs能否补偿小范围、局部的扰动?其脆弱性在何种尺度下变得显著?
  • RQ5蒸馏或架构设计(如MLP-Mixer)在基于令牌的攻击下如何影响模型的鲁棒性?

主要发现

  • 在单令牌攻击下,ResNets的鲁棒准确率相比ViTs最高可高出约30%,表明ViTs对单个令牌操作的敏感性显著更高。
  • 仅扰动1%的像素(ImageNet上256个像素)时,ViT-224在16×16补丁攻击下的鲁棒准确率降至13.62%,而ResNet-101在相同条件下仍保持49.50%的鲁棒准确率。
  • 当补丁尺寸与模型的令牌尺寸相匹配时,ViTs和DeIT的鲁棒准确率接近于零(例如ViT-384为4.98%),而ResNets仍保持32.89%的鲁棒准确率。
  • 在较大补丁攻击下,MLP-Mixer的鲁棒性优于ViT,表明注意力机制本身并不能保证鲁棒性。
  • 本研究揭示,先前关于ViT在$ε$-有界攻击下具有鲁棒性的说法,在现实、结构化的令牌攻击下是具有误导性的。
  • 在相同稀疏预算下,稀疏攻击(1×1像素)比补丁攻击更强,但补丁攻击更具实用性,并暴露出ViTs中更深层次的架构脆弱性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。