[论文解读] Local Differential Privacy for Federated Learning
该论文提出LDPFL,一种新颖的局部差分隐私(LDP)框架,用于跨孤岛工业场景下的联邦学习。通过将随机响应和优化的单值编码应用于一维展平的中间特征向量(而非模型权重),LDPFL在严格的隐私预算下(例如ε = 0.5)仍能实现高模型效用(最高达98%准确率),在隐私-效用权衡方面优于现有的LDP和GDP方法。
Advanced adversarial attacks such as membership inference and model memorization can make federated learning (FL) vulnerable and potentially leak sensitive private data. Local differentially private (LDP) approaches are gaining more popularity due to stronger privacy notions and native support for data distribution compared to other differentially private (DP) solutions. However, DP approaches assume that the FL server (that aggregates the models) is honest (run the FL protocol honestly) or semi-honest (run the FL protocol honestly while also trying to learn as much information as possible). These assumptions make such approaches unrealistic and unreliable for real-world settings. Besides, in real-world industrial environments (e.g., healthcare), the distributed entities (e.g., hospitals) are already composed of locally running machine learning models (this setting is also referred to as the cross-silo setting). Existing approaches do not provide a scalable mechanism for privacy-preserving FL to be utilized under such settings, potentially with untrusted parties. This paper proposes a new local differentially private FL (named LDPFL) protocol for industrial settings. LDPFL can run in industrial settings with untrusted entities while enforcing stronger privacy guarantees than existing approaches. LDPFL shows high FL model performance (up to 98%) under small privacy budgets (e.g., epsilon = 0.5) in comparison to existing methods.
研究动机与目标
- 为解决在存在不可信客户端和服务器的工业级跨孤岛联邦学习场景中,缺乏可扩展且保护隐私的机制的问题。
- 克服现有LDP方法在联邦学习中面临的局限,包括在小隐私预算下效用差以及对高维模型参数处理效率低的问题。
- 通过消除对可信协调者或聚合器的依赖,提供强于全局差分隐私方法的隐私保障。
- 通过不将LDP应用于模型权重,而是应用于中间特征表示,改善联邦学习中的隐私-效用权衡。
- 为医疗保健和智能农业等现实应用场景提供一种实用、高效且鲁棒的解决方案,这些场景中数据分布且隐私至关重要。
提出的方法
- LDPFL通过随机化从本地训练的深度神经网络中间输出提取的一维展平向量,而非直接扰动模型参数,来应用局部差分隐私。
- 它使用两种LDP机制——随机响应(RR)和优化单值编码(OUE)——以确保输入级别的差分隐私。
- 该方法在随机化的一维向量上训练第二个全连接DNN,从而在保护隐私的同时实现有效学习。
- 该架构将客户端模型分为用于特征提取的CNN和用于分类的DNN,随机化层位于特征展平之后。
- 通过将隐私预算(ε)应用于特征表示,实现高效分配,相比权重级扰动,可减少噪声影响。
- 该方法支持不可信的客户端和服务器,因为数据从未以原始形式离开客户端设备,仅共享随机化后的特征。
实验结果
研究问题
- RQ1能否在联邦学习中有效应用局部差分隐私机制于中间特征表示,以在严格隐私预算下提升效用?
- RQ2LDPFL在模型准确率和隐私-效用权衡方面与现有全局和局部DP方法相比如何?
- RQ3当ε低至0.5(在DP中被认为极为严格)时,LDPFL能否保持高模型性能(如>95%准确率)?
- RQ4与权重级相比,在特征级应用LDP是否能带来更好的深度学习联邦学习隐私-效用平衡?
- RQ5LDPFL能否在不可信的跨孤岛场景(如医疗保健或智能农业)中有效部署,而无需依赖可信服务器?
主要发现
- 在CIFAR10和SVHN数据集上,LDPFL在严格的隐私预算ε = 0.5下实现了高达98%的测试准确率,证明了在强隐私约束下仍具备高效率。
- 该方法在准确率和隐私-效用平衡方面优于现有的基于LDP的联邦学习方法,如α-CLDP-Fed和DPSGD,尤其在低ε值时表现更优。
- 通过随机化中间特征而非模型权重,LDPFL减轻了对高维参数矩阵的噪声负担,提升了模型收敛性和性能。
- 使用优化单值编码(OUE)和随机响应(RR)可在保留足够比特级信息以支持学习的同时,实现有效的隐私保障。
- 基准测试表明,当在严格隐私设置下需要高效率时,LDPFL优于SMC、GDP及其他LDP方法。
- 该架构可适配多种数据集,包括MNIST、FMNIST、CIFAR10和SVHN,在不同输入分辨率和模型配置下均表现出一致性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。