[论文解读] Federated $f$-Differential Privacy
本文提出了联邦$f$-微分隐私,一种专为联邦学习设计的记录级别隐私概念,可同时保护个体数据记录免受单个和合谋攻击者的侵害。提出PriFedSync框架,整合了最先进的联邦学习算法,并通过高斯微分隐私组合实现可证明的隐私保护,在视觉任务中清晰展示了隐私、准确率与计算成本之间的权衡。
Federated learning (FL) is a training paradigm where the clients collaboratively learn models by repeatedly sharing information without compromising much on the privacy of their local sensitive data. In this paper, we introduce federated $f$-differential privacy, a new notion specifically tailored to the federated setting, based on the framework of Gaussian differential privacy. Federated $f$-differential privacy operates on record level: it provides the privacy guarantee on each individual record of one client's data against adversaries. We then propose a generic private federated learning framework {PriFedSync} that accommodates a large family of state-of-the-art FL algorithms, which provably achieves federated $f$-differential privacy. Finally, we empirically demonstrate the trade-off between privacy guarantee and prediction performance for models trained by {PriFedSync} in computer vision tasks.
研究动机与目标
- 为解决联邦学习中个体数据记录隐私保障的空白,特别是当用户级别隐私过于严格而不适合实际应用时。
- 形式化一种新的隐私概念——弱联邦$f$-微分隐私与强联邦$f$-微分隐私,分别保护个体记录免受单个和合谋攻击者侵害。
- 设计一种通用、可组合且实用的私有联邦学习框架PriFedSync,支持个性化和全局模型,且无需可信服务器。
- 在异构、非独立同分布数据设置下,实证评估隐私、模型准确率与计算成本之间的权衡。
提出的方法
- 基于高斯微分隐私(GDP)提出弱联邦$f$-微分隐私与强联邦$f$-微分隐私概念,为每个个体数据记录提供隐私保障。
- 设计PriFedSync框架,整合标准联邦学习算法(如FedAvg、FedSGD),并在客户端注入噪声以确保隐私。
- 应用GDP的组合定理,推导出多个训练轮次和客户端更新下的累积隐私损失。
- 通过高斯机制在本地模型梯度上注入噪声,隐私参数按数据采样率和训练轮次数进行缩放。
- 采用个性化模型更新策略,客户端保持本地模型,仅共享聚合更新,从而在数据异构条件下提升性能。
- 通过渐近分析研究收敛性与隐私,理论保障基于GDP框架。
实验结果
研究问题
- RQ1我们能否在联邦学习中为个体记录级别提供隐私保障,而非仅在客户端级别?
- RQ2当多个恶意客户端合谋以推断私有信息时,如何保护个体数据记录?
- RQ3在私有联邦学习中,隐私、模型准确率与计算成本之间的权衡是什么?
- RQ4个性化联邦学习是否能在保持强隐私的前提下,提升数据异构条件下的性能?
- RQ5批量大小与训练轮次数的选择如何影响私有联邦学习中的隐私-准确率权衡?
主要发现
- 在非独立同分布数据设置下,PriFedSync中的个性化模型显著优于全局模型,在相同隐私预算下实现了更高的测试准确率。
- 较小的批量大小可带来更强的隐私保护(更低的隐私参数$\mu_{\max}$),在相同训练条件下,$B=8$的隐私参数约为$B=16$的0.83倍。
- 降低批量大小会增加计算成本:与$B=16$相比,$B=8$需要2.78倍的训练轮次和1.39倍的总样本数才能达到90%的准确率。
- 对于CIFAR-10数据集,当$\beta=0.5$时,经过207轮训练,$\sigma=0.5$下平均top-1测试准确率达到52%,而非私有模型达到59.61%。
- 对于私有模型,噪声Adam优化器表现出比SGD更好的稳定性,尽管SGD在非私有模型上泛化能力更强。
- 隐私参数$\mu_{\max}$与数据采样率和$\sqrt{KR}$的乘积呈线性关系,验证了理论隐私组合边界的正确性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。