Skip to main content
QUICK REVIEW

[论文解读] Backdoor Federated Learning by Poisoning Backdoor-Critical Layers

Haomin Zhuang, Mingxian Yu|arXiv (Cornell University)|Aug 8, 2023
Adversarial Robustness in Machine Learning被引用 4
一句话总结

本文提出了一种新型联邦学习后门攻击方法,针对后门关键(BC)层——即对后门漏洞负有主要责任的模型层——通过层替换分析识别这些层。通过仅用10%的客户端受损来污染这些关键层,该方法在规避七种最先进防御机制的同时,实现了极高的后门成功率,优于现有攻击方法的隐蔽性和有效性。

ABSTRACT

Federated learning (FL) has been widely deployed to enable machine learning training on sensitive data across distributed devices. However, the decentralized learning paradigm and heterogeneity of FL further extend the attack surface for backdoor attacks. Existing FL attack and defense methodologies typically focus on the whole model. None of them recognizes the existence of backdoor-critical (BC) layers-a small subset of layers that dominate the model vulnerabilities. Attacking the BC layers achieves equivalent effects as attacking the whole model but at a far smaller chance of being detected by state-of-the-art (SOTA) defenses. This paper proposes a general in-situ approach that identifies and verifies BC layers from the perspective of attackers. Based on the identified BC layers, we carefully craft a new backdoor attack methodology that adaptively seeks a fundamental balance between attacking effects and stealthiness under various defense strategies. Extensive experiments show that our BC layer-aware backdoor attacks can successfully backdoor FL under seven SOTA defenses with only 10% malicious clients and outperform the latest backdoor attack methods.

研究动机与目标

  • 识别并验证后门关键(BC)层的存在——即在联邦学习中主导后门漏洞的小部分模型层。
  • 开发一种通用的在位方法,供攻击者使用前向和后向层替换技术定位BC层。
  • 设计两种新型后门攻击方法——逐层污染(LP)攻击和逐层翻转(LF)攻击——专注于BC层以最大化隐蔽性和有效性。
  • 在多种防御策略下评估所提攻击方法,证明其在后门成功率和主任务准确率方面表现更优。
  • 证明BC层存在于多种架构中,包括卷积神经网络(CNNs)和自然语言处理模型(如BERT和LSTM)

提出的方法

  • 提出层替换分析:通过在良性和恶意模型之间迭代替换层,基于后门成功率的变化识别BC层。
  • 使用前向替换(将恶意层插入良性模型)和后向替换(将良性层插入恶意模型)来隔离关键层。
  • 设计LP攻击(逐层污染)和LF攻击(逐层翻转),仅对识别出的BC层进行污染,且仅做最小的权重修改。
  • 调整攻击策略以在距离-based、反演-based和符号-based防御下实现效果与隐蔽性的平衡,降低被检测风险。
  • 在多种模型(CNNs、ResNet18、VGG19、BERT、DistilBERT、LSTM)和数据集(CIFAR-10、SVHN、SST-2、Reddit)上应用该方法。
  • 采用客户端级别的污染策略,仅10%的客户端为恶意,模拟现实的联邦学习威胁模型。

实验结果

研究问题

  • RQ1是否存在特定的模型层——即后门关键(BC)层——在联邦学习中主导后门攻击的漏洞?
  • RQ2是否可以仅通过在位层替换技术可靠地识别BC层,而无需事先知晓模型架构或训练数据?
  • RQ3是否可以通过仅聚焦于BC层而非整个模型,显著提升后门攻击的隐蔽性和有效性?
  • RQ4所提出的逐层攻击在七种最先进联邦学习防御机制下的表现如何?
  • RQ5BC层是否存在于计算机视觉和自然语言处理模型中,并可被识别?

主要发现

  • 后门关键层存在,且几乎决定了所有后门成功;仅移除一个BC层(如fc1.weight)即可使后门成功率降至接近零。
  • 所提出的层替换分析在多种模型中成功识别出BC层,包括ResNet18、VGG19、BERT和两层LSTM。
  • LP和LF攻击在所有评估的防御机制下均实现100%的后门成功率,且仅需10%的恶意客户端,优于现有攻击方法(如DBA)。
  • 攻击在干净数据上保持高主任务准确率(>95%),表明对模型实用性影响极小。
  • 在自然语言处理模型中,BC层主要位于注意力机制矩阵(Q、K、V)和输出全连接层,而非BERT和DistilBERT中的最终分类器层。
  • 在自然语言处理模型中,BC层所占比例低于总层数的25%,表明其稀疏性与战略重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。