Skip to main content
QUICK REVIEW

[论文解读] Provably Secure Federated Learning against Malicious Clients

Xiaoyu Cao, Jinyuan Jia|arXiv (Cornell University)|Feb 3, 2021
Privacy-Preserving Technologies in Data被引用 7
一句话总结

本文提出集成联邦学习,一种可证明安全的防御机制,用于抵御联邦学习中恶意客户端的攻击。通过在随机选择的客户端子集上训练多个全局模型,并在推理时采用多数投票机制,该方法确保预测标签不受最多受限数量的恶意客户端影响,在1000个客户端中有20个被攻破的情况下,MNIST数据集上的认证准确率达到88%。

ABSTRACT

Federated learning enables clients to collaboratively learn a shared global model without sharing their local training data with a cloud server. However, malicious clients can corrupt the global model to predict incorrect labels for testing examples. Existing defenses against malicious clients leverage Byzantine-robust federated learning methods. However, these methods cannot provably guarantee that the predicted label for a testing example is not affected by malicious clients. We bridge this gap via ensemble federated learning. In particular, given any base federated learning algorithm, we use the algorithm to learn multiple global models, each of which is learnt using a randomly selected subset of clients. When predicting the label of a testing example, we take majority vote among the global models. We show that our ensemble federated learning with any base federated learning algorithm is provably secure against malicious clients. Specifically, the label predicted by our ensemble global model for a testing example is provably not affected by a bounded number of malicious clients. Moreover, we show that our derived bound is tight. We evaluate our method on MNIST and Human Activity Recognition datasets. For instance, our method can achieve a certified accuracy of 88% on MNIST when 20 out of 1,000 clients are malicious.

研究动机与目标

  • 解决联邦学习对恶意客户端的脆弱性问题,这些客户端可能通过操纵更新来污染全局模型。
  • 开发一种防御机制,可严格保证测试样本的预测标签正确性,即使部分客户端为恶意。
  • 提供一个紧密的、理论基础坚实的认证安全级别,该级别无法在不引入额外假设的前提下被超越。
  • 设计一种可扩展的算法,用于在大规模联邦学习环境中估计认证安全级别。

提出的方法

  • 该方法使用基础联邦学习算法训练多个全局模型,每个模型基于从总n个客户端中随机选择的k个客户端子集进行训练。
  • 对于每个测试样本,通过所有全局模型的多数投票进行标签预测,选择得票最多的标签作为最终输出。
  • 认证安全级别定义为:在多数投票标签保持不变的前提下,最多可容忍的恶意客户端数量。
  • 当子集数量过大而无法进行精确计算时,采用蒙特卡洛算法来估计最大和第二大的标签概率。
  • 理论分析证明,所推导出的认证安全级别是紧致的,即在不引入对基础算法更强假设的前提下,无法获得更大的边界。
  • 该方法在MNIST和人类活动识别数据集上进行了评估,实验考虑了不同非独立同分布(non-IID)数据程度和恶意客户端比例。

实验结果

研究问题

  • RQ1联邦学习系统是否可以可证明地保证,测试样本的预测标签不受有限数量恶意客户端的影响?
  • RQ2在相同假设下,是否可以推导出一个无法被其他方法超越的紧致认证安全级别?
  • RQ3该集成方法在不同数据非独立同分布程度和恶意客户端比例下的性能表现如何?
  • RQ4能否设计一种高效算法,在不训练所有可能的全局模型的前提下,估计认证安全级别?

主要发现

  • 在1000个客户端中有20个为恶意客户端的情况下,集成联邦学习方法在MNIST数据集上实现了88%的认证准确率,展现出强大的鲁棒性。
  • 即使在高度非独立同分布的数据分布(q = 0.9)下,当仅有10个客户端为恶意时,认证准确率仍保持在83%,表明对数据异质性具有强鲁棒性。
  • 当全局模型数量超过某一阈值后,认证准确率趋于饱和,表明在达到一定集成数量后,继续增加模型数量带来的收益递减。
  • 所推导出的认证安全级别被严格证明为紧致,即在不引入对基础联邦学习算法更强假设的前提下,任何其他方法都无法获得更高的边界。
  • 蒙特卡洛估计算法实现了认证安全级别的可扩展计算,使该方法在大规模客户端池中具备实际可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。