Skip to main content
QUICK REVIEW

[论文解读] DBIA: Data-free Backdoor Injection Attack against Transformer Networks

Peizhuo Lv, Hualong Ma|arXiv (Cornell University)|Nov 22, 2021
Adversarial Robustness in Machine Learning参考文献 36被引用 7
一句话总结

本文提出DBIA,一种针对视觉Transformer模型的数据无关后门攻击方法,利用注意力机制生成高注意力触发器,并通过投影梯度下降法仅微调少数神经元。该方法在ImageNet上实现91.61%的攻击成功率,在CIFAR-10上实现91.07%的攻击成功率,性能下降低于2.5%,且仅使用单张GPU在8分钟内完成后门注入。

ABSTRACT

Recently, transformer architecture has demonstrated its significance in both Natural Language Processing (NLP) and Computer Vision (CV) tasks. Though other network models are known to be vulnerable to the backdoor attack, which embeds triggers in the model and controls the model behavior when the triggers are presented, little is known whether such an attack is still valid on the transformer models and if so, whether it can be done in a more cost-efficient manner. In this paper, we propose DBIA, a novel data-free backdoor attack against the CV-oriented transformer networks, leveraging the inherent attention mechanism of transformers to generate triggers and injecting the backdoor using the poisoned surrogate dataset. We conducted extensive experiments based on three benchmark transformers, i.e., ViT, DeiT and Swin Transformer, on two mainstream image classification tasks, i.e., CIFAR10 and ImageNet. The evaluation results demonstrate that, consuming fewer resources, our approach can embed backdoors with a high success rate and a low impact on the performance of the victim transformers. Our code is available at https://anonymous.4open.science/r/DBIA-825D.

研究动机与目标

  • 探究在无法访问原始训练数据的情况下,视觉Transformer模型是否容易受到后门攻击。
  • 开发一种成本高效、数据无关的后门注入方法,避免依赖原始数据集或大量参数调优。
  • 利用Transformer的注意力机制生成能最大化模型注意力的触发器,以增强后门攻击的有效性。
  • 在实现高攻击成功率的同时,将主任务性能下降降至最低。

提出的方法

  • 通过优化输入块以最大化受害Transformer模型自注意力层中的注意力权重,生成注意力最大化触发器。
  • 使用这些注意力最大化触发器构建一个替代数据集,并将其标记为目标类别,以模拟中毒训练集。
  • 仅使用投影梯度下降法对模型中极少数神经元(参数量的2.01%至5.90%)进行微调,使触发器与目标类别对齐。
  • 通过设置$\epsilon=2$的扰动幅度约束,以保持原始模型在干净输入上的性能。
  • 采用注意力率(AR)作为评估指标,衡量触发器捕获模型注意力的有效性,AR值越高表示触发器聚焦能力越强。
  • 通过引入自适应损失项,使攻击能够规避Grad-CAM等注意力基防御方法,从而误导注意力定位。

实验结果

研究问题

  • RQ1在无法访问原始训练数据的情况下,是否能够有效实施针对视觉Transformer模型的后门攻击?
  • RQ2注意力最大化触发器在聚焦模型注意力并实现高后门成功率方面效果如何?
  • RQ3在极小参数更新和低性能下降的前提下,后门注入能达到何种程度?
  • RQ4所提出的方法能否规避基于注意力的防御机制(如Grad-CAM或SentiNet)?

主要发现

  • DBIA仅使用替代数据集且无需访问原始数据,在ImageNet上实现了91.61%的平均攻击成功率,在CIFAR-10上实现了91.07%的攻击成功率。
  • 在干净图像上的性能下降被限制在ImageNet的2.5%以内,CIFAR-10的3%以内,表明对主任务影响极小。
  • 后门注入在DeiT上最快仅需16秒,在CIFAR-10的DeiT上仅需4秒,显示出极高的效率。
  • 生成触发器的注意力率(AR)在DeiT上最高(18.45%),与之对应的是最短的注入时间与最强的后门性能。
  • 在ResNet50和VGG19上,攻击成功率仅为33.65%和33.20%,且准确率显著下降(分别下降12.35%和18.00%),凸显该方法在Transformer模型上的泛化优势。
  • 自适应损失项通过误导注意力定位,提升了对基于Grad-CAM防御的抵抗能力,展现出规避检测的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。