[论文解读] Voting-based Approaches For Differentially Private Federated Learning
本文提出了两种基于投票的差分隐私联邦学习方法,AE-DPFL 和 kNN-DPFL,通过使用基于标签的投票替代梯度平均,消除了与维度相关的噪声并降低了通信成本。该方法在大模型场景下实现了更优的隐私-效用权衡,并利用安全多方计算在投票优势较大时实现指数级隐私增强。
Differentially Private Federated Learning (DPFL) is an emerging field with many applications. Gradient averaging based DPFL methods require costly communication rounds and hardly work with large-capacity models, due to the explicit dimension dependence in its added noise. In this work, inspired by knowledge transfer non-federated privacy learning from Papernot et al.(2017; 2018), we design two new DPFL schemes, by voting among the data labels returned from each local model, instead of averaging the gradients, which avoids the dimension dependence and significantly reduces the communication cost. Theoretically, by applying secure multi-party computation, we could exponentially amplify the (data-dependent) privacy guarantees when the margin of the voting scores are large. Extensive experiments show that our approaches significantly improve the privacy-utility trade-off over the state-of-the-arts in DPFL.
研究动机与目标
- 解决差分隐私联邦学习(DPFL)中基于梯度平均的方法存在的高通信成本与可扩展性差的问题,这些问题源于与维度相关的噪声和梯度裁剪。
- 克服现有 DPFL 方法(如 DP-FedAvg 和 DP-FedSGD)的局限性,这些方法需要大量通信轮次,并且在模型容量增大时性能下降。
- 设计新型 DPFL 框架,基于知识迁移模型,利用无标签公共数据以改善隐私-效用权衡。
- 通过安全多方计算与基于投票的聚合,为代理级别和实例级别提供可证明的差分隐私保证。
- 证明标签投票可避免梯度裁剪与噪声注入,从而在数据分布变化下实现更好的收敛性与鲁棒性。
提出的方法
- 以私有标签投票替代梯度聚合:每个本地模型在公共无标签数据上进行预测,服务器通过差分私有的计票机制聚合投票结果。
- 在 AE-DPFL 中采用适配于联邦学习的私有教师集成聚合(PATE)框架,其中多个本地模型对公共数据的标签进行投票。
- 在 kNN-DPFL 中,基于公共数据的特征嵌入计算 k-最近邻,并对票数添加噪声以保障隐私。
- 应用安全多方计算(MPC)计算私有票数,而无需暴露个体贡献,从而实现强隐私放大。
- 利用数据依赖的隐私放大机制:当某一标签以较大优势胜出时,通过 MPC 实现指数级隐私保证提升。
- 使用预训练主干网络(如 ResNet50、AlexNet)进行特征提取,并在客户端数据上训练本地模型后,再对公共数据进行标签投票。
实验结果
研究问题
- RQ1基于标签的投票能否替代 DPFL 中的梯度平均,以降低通信成本并消除与维度相关的噪声?
- RQ2基于投票的 DPFL 是否在隐私-效用权衡上优于基于梯度的 DPFL 方法(如 DP-FedAvg 和 DP-FedSGD)?
- RQ3当投票优势较大时,安全多方计算能否在 DPFL 中实现指数级隐私增强?
- RQ4基于投票的 DPFL 在模型容量增大和数据分布变化下,性能如何扩展?
- RQ5在强敌手环境下,该方法是否能在代理级别和实例级别均维持强隐私保证?
主要发现
- 当从 AlexNet 迁移到 ResNet50 时,kNN-DPFL 的效用提升 10%,而 DP-FedSGD 的性能下降,表明其在大模型上具有更优的可扩展性。
- 在 Office-Caltech 数据集上,kNN-DPFL 在相同隐私预算下准确率比 DP-FedSGD 高出 10% 以上,或在相同准确率下将隐私成本降低 60% 以上。
- 在 DomainNet 数据集上,当隐私预算对齐时,kNN-DPFL 的准确率比 DP-FedSGD 高出 10% 以上。
- AE-DPFL 和 kNN-DPFL 在所有设置下均一致优于 DP-FedAvg 的准确率,尤其在客户端数据量较低时优势更明显。
- DP-FedAvg 的性能随代理数量增加而呈现递减效应,而 kNN-DPFL 即使在 800 个代理下仍保持显著优势。
- 当每个代理的本地数据少于 50 个样本时,两种方法性能均下降,表明可靠标签聚合存在一个性能阈值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。