[论文解读] Efficient Backdoor Attacks for Deep Neural Networks in Real-world Scenarios
本文提出了一种基于CLIP的新型后门攻击框架,适用于数据受限场景,即攻击者无法访问完整训练数据时,通过利用干净特征抑制(Clean Feature Suppression)和中毒特征增强(Poisoning Feature Augmentation)来提升攻击成功率。在现实的多源数据采集设置下,该方法相比先前方法将攻击成功率提升了超过100%。
Recent deep neural networks (DNNs) have came to rely on vast amounts of training data, providing an opportunity for malicious attackers to exploit and contaminate the data to carry out backdoor attacks. However, existing backdoor attack methods make unrealistic assumptions, assuming that all training data comes from a single source and that attackers have full access to the training data. In this paper, we introduce a more realistic attack scenario where victims collect data from multiple sources, and attackers cannot access the complete training data. We refer to this scenario as data-constrained backdoor attacks. In such cases, previous attack methods suffer from severe efficiency degradation due to the entanglement between benign and poisoning features during the backdoor injection process. To tackle this problem, we introduce three CLIP-based technologies from two distinct streams: Clean Feature Suppression and Poisoning Feature Augmentation.effective solution for data-constrained backdoor attacks. The results demonstrate remarkable improvements, with some settings achieving over 100% improvement compared to existing attacks in data-constrained scenarios. Code is available at https://github.com/sunh1113/Efficient-backdoor-attacks-for-deep-neural-networks-in-real-world-scenarios
研究动机与目标
- 填补现有后门攻击方法中假设可完全访问训练数据的空白,该假设在现实世界的多源数据采集中并不现实。
- 解决先前方法在数据受限场景下,当中毒数据分布与训练数据分布不一致时性能下降的问题。
- 开发高效且隐蔽的后门攻击方法,即使攻击者仅控制部分数据源,也能保持有效性。
- 在实际部署场景中确保高攻击成功率,同时保持良性准确率并最小化可检测性。
提出的方法
- 利用预训练的CLIP模型提取并操纵干净数据和中毒数据的特征表示。
- 提出干净特征抑制(CLIP-UAP),以减少良性特征的影响,使中毒特征更加突出。
- 应用中毒特征增强(CLIP-CFA),以放大后门触发特征的表征和影响。
- 集成CLIP-CFE(对比特征增强)以进一步强化中毒特征的对齐性和独特性。
- 设计针对三种数据受限后门攻击场景的攻击流水线:数量受限、类别受限和领域受限。
- 利用CLIP的视觉-语言对齐能力,提升在不同数据集和目标模型之间的可迁移性和鲁棒性。

实验结果
研究问题
- RQ1在攻击者无法完全访问训练数据的数据受限场景下,后门攻击的成功率如何下降?
- RQ2当中毒数据有限且分布不匹配时,基于CLIP的特征操纵技术能否提升后门攻击的有效性?
- RQ3干净特征抑制与中毒特征增强在保持良性准确率的同时,能在多大程度上提升攻击成功率?
- RQ4所提出方法在不同预训练CLIP模型和目标架构上的鲁棒性如何?
- RQ5所提出的框架能否推广至其他后门攻击场景,如干净标签攻击或领域受限攻击?
主要发现
- 所提出的基于CLIP的方法在数据受限场景下相比基线方法(如BadNets和Blended)将攻击成功率提升了超过100%。
- 干净特征抑制(CLIP-UAP)与中毒特征增强(CLIP-CFA)显著提升了攻击有效性,尤其在类别受限和领域受限设置中表现突出。
- CLIP-CFE的集成进一步提升了所有触发类型和设置下的攻击成功率,证明了其在特征层面进行有效中毒的强大能力。
- 该方法在所有评估设置下均保持了高良性准确率,证实了其隐蔽性和实际可行性。
- 该方法在多个CLIP变体上表现出稳健性能,其中ViT-B/32作为攻击流水线的主干网络尤为有效。
- 消融实验表明,CLIP-UAP与CLIP-CFA在提升攻击性能方面均具有独立且协同的作用,尤其在低中毒率和高领域差异条件下表现显著。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。