Skip to main content
QUICK REVIEW

[论文解读] RFLBAT: A Robust Federated Learning Algorithm against Backdoor Attack

Yongkang Wang, Di‐Hua Zhai|arXiv (Cornell University)|Jan 11, 2022
Network Security and Intrusion Detection被引用 9
一句话总结

RFLBAT 是一种新颖的鲁棒联邦学习算法,通过使用主成分分析(PCA)和K均值聚类来检测并排除恶意梯度,从而抵御后门攻击,且无需事先知晓攻击者数量或数据分布。该方法在多种攻击场景下均优于当前最先进方法,包括非独立同分布(non-IID)数据、客户端数量变化以及分布式后门攻击,即使恶意客户端数量超过良性客户端也表现优异。

ABSTRACT

Federated learning (FL) is a distributed machine learning paradigm where enormous scattered clients (e.g. mobile devices or IoT devices) collaboratively train a model under the orchestration of a central server (e.g. service provider), while keeping the training data decentralized. Unfortunately, FL is susceptible to a variety of attacks, including backdoor attack, which is made substantially worse in the presence of malicious attackers. Most of algorithms usually assume that the malicious at tackers no more than benign clients or the data distribution is independent identically distribution (IID). However, no one knows the number of malicious attackers and the data distribution is usually non identically distribution (Non-IID). In this paper, we propose RFLBAT which utilizes principal component analysis (PCA) technique and Kmeans clustering algorithm to defend against backdoor attack. Our algorithm RFLBAT does not bound the number of backdoored attackers and the data distribution, and requires no auxiliary information outside of the learning process. We conduct extensive experiments including a variety of backdoor attack types. Experimental results demonstrate that RFLBAT outperforms the existing state-of-the-art algorithms and is able to resist various backdoor attack scenarios including different number of attackers (DNA), different Non-IID scenarios (DNS), different number of clients (DNC) and distributed backdoor attack (DBA).

研究动机与目标

  • 解决联邦学习在后门攻击下的关键脆弱性,特别是在攻击者数量和数据非独立同分布(non-IID)分布未知的现实条件下。
  • 克服现有鲁棒聚合方法的局限性,这些方法依赖于强假设,如恶意客户端数量少于良性客户端或数据分布为独立同分布(IID)。
  • 开发一种防御机制,可在不访问训练或测试数据的情况下检测并排除被污染的模型更新,从而确保隐私保护。
  • 在极端场景下保持鲁棒性,包括恶意客户端主导训练过程或攻击在多个客户端间分布的情况。
  • 提供一种可扩展的无监督防御方法,利用梯度结构通过PCA和聚类区分良性与中毒更新。

提出的方法

  • 对客户端模型更新应用主成分分析(PCA),以降低维度并揭示潜在的梯度结构,从而更清晰地区分良性与中毒梯度。
  • 在PCA降维后的梯度上应用K均值聚类,将相似的更新分组,其中良性梯度自然形成紧密簇,而中毒梯度则表现为明显异常值。
  • 使用梯度向量之间的余弦相似度识别并选择最具代表性的良性梯度,用于全局模型聚合。
  • 仅通过加权平均聚合所选的良性梯度,构建更新后的全局模型,从而有效排除恶意更新。
  • 动态调整PCA中的尺度因子,以增强良性与中毒梯度之间的可分性,提升在不同攻击强度下的检测准确性。
  • 完全无监督运行——无需标注数据、无需辅助模型,也无需对攻击者数量或数据分布做出任何假设。

实验结果

研究问题

  • RQ1鲁棒聚合算法是否能在未知恶意客户端数量的情况下检测并排除中毒梯度?
  • RQ2在非独立同分布(non-IID)数据分布下,RFLBAT在防御后门攻击方面的有效性如何,而现有方法在此类场景下常会失效?
  • RQ3当参与的客户端数量或攻击者数量显著变化时,RFLBAT能否保持高模型准确率和鲁棒性?
  • RQ4在分布式后门攻击中,即多个客户端协同在不同数据子集上注入触发器时,RFLBAT的表现如何?
  • RQ5当恶意客户端数量超过良性客户端时,RFLBAT是否仍有效?这一情形会破坏大多数先前防御方法的假设。

主要发现

  • 在所有评估的后门攻击场景下,RFLBAT 的测试准确率显著高于当前最先进防御方法,包括不同攻击者数量(DNA)、非独立同分布数据(DNS)、客户端数量变化(DNC)以及分布式后门攻击(DBA)。
  • 在分布式后门攻击(DBA)场景中,即使中毒客户端对其梯度进行放大,RFLBAT 仍能保持高性能,展现出对梯度操纵的鲁棒性。
  • PCA降维后梯度的可视化显示,在尺度因子 λ=100 时,良性与中毒梯度可清晰分离为不同簇,从而实现准确检测与排除。
  • 在 λ=1 时,梯度过于分散,导致聚类不可靠,部分良性梯度被错误排除;然而在 λ=100 时,所有良性梯度均被成功捕获于单一簇中。
  • RFLBAT 在准确率和鲁棒性方面均优于现有方法(如 Krum、Bulyan 和 FoolsGold),尤其在高攻击率和非独立同分布设置下表现更优。
  • 即使恶意客户端数量超过良性客户端,该算法依然有效,而大多数先前防御方法因假设不成立而在此类情形下失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。