[论文解读] Protecting Data from all Parties: Combining FHE and DP in Federated Learning
该论文提出了一种新颖的联邦学习框架,通过结合同态加密(HE)与差分隐私(DP),联合保护所有参与方——客户端、服务器和最终用户——的训练数据隐私。该框架引入了一种基于泊松分布的随机量化算子,以在HE的量化约束下仍能保持DP的保障,实验证明其在FEMNIST数据集上具备实际的模型准确率与计算可行性。
This paper tackles the problem of ensuring training data privacy in a federated learning context. Relying on Homomorphic Encryption (HE) and Differential Privacy (DP), we propose a framework addressing threats on the privacy of the training data. Notably, the proposed framework ensures the privacy of the training data from all actors of the learning process, namely the data owners and the aggregating server. More precisely, while HE blinds a semi-honest server during the learning protocol, DP protects the data from semi-honest clients participating in the training process as well as end-users with black-box or white-box access to the trained model. In order to achieve this, we provide new theoretical and practical results to allow these techniques to be rigorously combined. In particular, by means of a novel stochastic quantisation operator, we prove DP guarantees in a context where the noise is quantised and bounded due to the use of HE. The paper is concluded by experiments which show the practicality of the entire framework in terms of both model quality (impacted by DP) and computational overhead (impacted by HE).
研究动机与目标
- 解决联邦学习中半诚实客户端和服务器带来的隐私威胁,二者可能通过模型更新推断出敏感数据。
- 通过保护来自所有参与方(数据所有者、参与客户端、服务器以及拥有模型访问权限的最终用户)的数据,实现端到端隐私。
- 克服差分隐私(需要注入噪声)与同态加密(需要有界、量化输入)之间的不兼容性。
- 设计一种量化机制,即使在HE约束导致噪声被量化的情况下,也能保持DP的保障。
- 在模型准确率、隐私成本与计算开销方面,证明HE+DP联合框架的实际可行性。
提出的方法
- 在传输前通过注入参数化精细的高斯噪声,对客户端更新应用差分隐私。
- 使用同态加密在发送至服务器前对客户端更新进行加密,确保服务器无法访问原始数据或中间结果。
- 引入一种基于泊松分布的新型随机量化算子,将连续的、带噪声的梯度映射为适合HE处理的离散值。
- 证明所提出的量化方法可保持底层高斯机制的差分隐私保障,无需额外的隐私分析。
- 将量化算子作为噪声注入后的后处理步骤集成,确保尽管经过量化,隐私预算仍保持不变。
- 在跨孤岛联邦学习设置中实现该框架,基于FEMNIST数据集进行评估,采用医疗或机构合作中的实际参数。
实验结果
研究问题
- RQ1在联邦学习中,能否严格结合差分隐私与同态加密而不损害隐私保障?
- RQ2当为隐私保护而添加的噪声因同态加密的约束而受到量化时,如何保持差分隐私?
- RQ3何种量化机制可实现DP与HE的无缝集成,同时确保所有参与方的端到端隐私?
- RQ4在联邦学习管道中同时应用HE与DP时,模型准确率与计算开销之间的权衡如何?
- RQ5所提出的框架能否扩展至真实世界应用,如医疗AI,其中数据敏感性与机构间协作至关重要?
主要发现
- 基于泊松分布的新型随机量化算子可保持底层高斯机制的差分隐私保障,无需额外的隐私分析。
- 该框架确保了端到端隐私:数据受到服务器(通过HE)的保护,受到客户端(通过DP)的保护,也受到最终用户(通过模型输出上的DP)的保护。
- 在FEMNIST数据集上的实验表明,尽管采用了隐私保护机制,模型仍保持可接受的准确率,DP导致的性能下降虽可测量但可控。
- 同态加密引入的计算开销是有限且实际可行的,尤其在客户端数量适中的跨孤岛设置中。
- 活跃客户端占总客户端的比例($K/M$)显著影响DP效用,增加$M$可在保持模型性能的同时提升隐私保障。
- 该框架与可验证计算扩展兼容,为未来抵御恶意服务器提供了可行路径。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。