[论文解读] Attention Hijacking in Trojan Transformers
本文揭示了受后门攻击的 BERT 和视觉 Transformer 中的注意力劫持模式,即触发令牌在所有输入中均主导注意力权重,无论输入内容如何。作者提出 AHTD,一种利用该模式的无监督与有监督后门检测方法,在自然语言处理与计算机视觉基准测试中均实现了最先进检测性能,AUC 分数超过 0.97。
Trojan attacks pose a severe threat to AI systems. Recent works on Transformer models received explosive popularity and the self-attentions are now indisputable. This raises a central question: Can we reveal the Trojans through attention mechanisms in BERTs and ViTs? In this paper, we investigate the attention hijacking pattern in Trojan AIs, \ie, the trigger token ``kidnaps'' the attention weights when a specific trigger is present. We observe the consistent attention hijacking pattern in Trojan Transformers from both Natural Language Processing (NLP) and Computer Vision (CV) domains. This intriguing property helps us to understand the Trojan mechanism in BERTs and ViTs. We also propose an Attention-Hijacking Trojan Detector (AHTD) to discriminate the Trojan AIs from the clean ones.
研究动机与目标
- 探究 BERT 与 ViT 中的注意力机制是否在受后门影响的模型中表现出一致的模式。
- 理解注意力劫持如何影响受后门攻击 AI 模型的表征学习与全局信息整合。
- 开发一种适用于自然语言处理与计算机视觉 Transformer 的通用检测方法。
- 提出一种无需干净数据或模型架构假设的检测框架。
提出的方法
- 本文识别出注意力劫持模式:当触发词存在时,特定注意力头在所有输入中均持续关注触发令牌。
- 提出一种无监督的 AHTD 方法,通过测量污染输入中注意力在触发令牌上的集中程度来检测后门。
- 提出 AHTD 的有监督变体,利用注意力模式作为特征,对干净模型与后门模型进行二分类。
- 该方法在微调后的 BERT(IMDB、SST-2 和 YELP 数据集)以及在 MNIST 和 CIFAR-10 上训练的 ViT 上进行了评估,涵盖多种触发类型。
- 该方法仅依赖于污染样本的注意力权重,无需比较干净与污染样本的注意力分布。
- 作者发布了包含后门 BERT 与 ViT 的数据集,以支持可复现性与基准测试。
实验结果
研究问题
- RQ1BERT 与 ViT 中的注意力机制是否能在受后门影响的模型中揭示出一致的模式?
- RQ2无论输入内容如何,触发令牌是否始终主导注意力权重,表明存在一种普遍的注意力劫持模式?
- RQ3注意力劫持如何影响受后门攻击 AI 模型的表征学习与全局信息流?
- RQ4能否利用注意力劫持构建一种适用于自然语言处理与计算机视觉领域的通用后门检测器?
- RQ5注意力劫持模式在不同 Transformer 架构(如 BERT 与 ViT)中是否保持不变?
主要发现
- 在 BERT 与 ViT 中均一致观察到注意力劫持模式,即在特定注意力头中,触发令牌在所有输入中均主导注意力权重,与输入内容无关。
- 无监督 AHTD 在 IMDB 上取得 0.97 的 AUC,在 YELP 上为 0.94,在 SST-2 上为 0.95,优于所有基线方法。
- 有监督 AHTD 在 IMDB 上取得 0.98 的 AUC,在 YELP 上为 0.96,在 SST-2 上为 0.95,展现出更优的检测能力。
- 在计算机视觉基准测试中,无监督 AHTD 在 MNIST 上取得 0.97 AUC,在 CIFAR-10 上取得 0.99 AUC,显著优于现有方法。
- 注意力劫持模式与增强的全局信息整合相关,并影响模型的嵌入表示。
- 该方法在不同触发类型与架构间具有泛化能力,证实了注意力劫持模式在 Transformer 中的不变性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。