[论文解读] Characterizing Internal Evasion Attacks in Federated Learning
该论文提出 pFedDef,一种个性化联邦学习框架,通过结合对抗训练与客户端特定模型个性化,抵御内部逃避攻击——即恶意客户端利用共享模型知识,构造隐蔽且成功率高的逃避攻击。实验表明,与标准联邦对抗训练相比,pFedDef 将内部攻击鲁棒性提升了 60%,同时在资源有限条件下仍保持优异性能。
Federated learning allows for clients in a distributed system to jointly train a machine learning model. However, clients' models are vulnerable to attacks during the training and testing phases. In this paper, we address the issue of adversarial clients performing "internal evasion attacks": crafting evasion attacks at test time to deceive other clients. For example, adversaries may aim to deceive spam filters and recommendation systems trained with federated learning for monetary gain. The adversarial clients have extensive information about the victim model in a federated learning setting, as weight information is shared amongst clients. We are the first to characterize the transferability of such internal evasion attacks for different learning methods and analyze the trade-off between model accuracy and robustness depending on the degree of similarities in client data. We show that adversarial training defenses in the federated learning setting only display limited improvements against internal attacks. However, combining adversarial training with personalized federated learning frameworks increases relative internal attack robustness by 60% compared to federated adversarial training and performs well under limited system resources.
研究动机与目标
- 刻画联邦学习中内部逃避攻击的威胁,其中对抗性客户端利用共享模型权重来构造有效的逃避攻击。
- 分析在不同数据相似性及联邦学习方法下,模型准确率与鲁棒性之间的权衡。
- 评估对抗训练在防御内部攻击方面的有效性,特别是在攻击者拥有完整模型知识的白盒设置下。
- 探讨个性化联邦学习如何通过降低客户端间模型相似性,缓解此威胁。
- 研究不同训练框架下联邦学习系统对集成攻击与 Sybil 攻击的韧性。
提出的方法
- 提出 pFedDef 框架,将对抗训练整合到个性化联邦学习中,每个客户端维护个性化模型,仅共享全局模型更新。
- 采用灰盒威胁模型,攻击者对目标模型具有部分知识,模拟联邦系统中真实的内部攻击场景。
- 利用聚合过程中共享的模型权重,基于梯度生成逃避攻击,构造可在客户端间转移的扰动。
- 在多种联邦学习方法(FedAvg、FedEM 及其带与不带对抗训练的个性化变体)上评估攻击的可迁移性。
- 通过组合多个对抗性客户端的扰动实施集成攻击,以提高攻击成功率,模拟协同威胁。
- 通过标签翻转投毒攻击评估对 Sybil 攻击的鲁棒性,比较标准训练与对抗训练模型在不同聚合策略下的表现。
实验结果
研究问题
- RQ1客户端间数据相似度程度如何影响联邦学习中内部逃避攻击的可迁移性?
- RQ2当攻击者拥有对目标模型的白盒访问权限时,仅靠对抗训练在多大程度上能降低内部逃避攻击的成功率?
- RQ3个性化联邦学习是否能在不牺牲模型准确率的前提下,提升对内部逃避攻击的鲁棒性?
- RQ4由多个对抗性客户端生成的集成攻击,对采用与不采用个性化的联邦模型的防御效果如何?
- RQ5pFedDef 及其他框架在训练过程中对 Sybil 风格数据投毒攻击的韧性如何?
主要发现
- 由于对目标模型拥有白盒访问权限,内部逃避攻击比外部攻击更有效,尤其在 FedAvg 和 FedEM 中,因模型相似性高,导致攻击可迁移性极强。
- 仅靠对抗训练对内部攻击的防御效果有限,因为对抗性客户端可利用完整模型知识构造出成功的逃避扰动。
- 由于个性化降低了客户端间的模型相似性,pFedDef 相较于联邦对抗训练(FAT)将内部攻击鲁棒性提升了 60%。
- 即使面对涉及多个对抗性客户端的集成攻击,pFedDef 仍保持强鲁棒性,优于 FedEM 和 FedAvg,后两者在集成成员增多时攻击成功率持续上升。
- Sybil 攻击会降低 FedEM 和 FedAvg 的测试准确率,但 FAT 和 pFedDef 因在训练中接触过对抗样本,表现出更强的韧性。
- 本地训练与对抗性本地训练受攻击步数影响最小,因模型差异大,但整体测试准确率较低,凸显了鲁棒性与性能之间的权衡。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。