Skip to main content
QUICK REVIEW

[论文解读] PrivFairFL: Privacy-Preserving Group Fairness in Federated Learning

Sikha Pentyala, Nicola Neophytou|arXiv (Cornell University)|May 23, 2022
Privacy-Preserving Technologies in Data被引用 13
一句话总结

PrivFairFL 提出了一种新颖的框架,用于在跨设备联邦学习中训练群体公平的机器学习模型,通过结合安全多方计算(MPC)与差分隐私(DP),实现对敏感属性统计信息的隐私保护聚合,而无需暴露原始客户端数据。该方法在极小的性能损失下实现了最先进的公平性,优于本地差分隐私基线方法,在公平性和模型准确率方面均表现更优。

ABSTRACT

Group fairness ensures that the outcome of machine learning (ML) based decision making systems are not biased towards a certain group of people defined by a sensitive attribute such as gender or ethnicity. Achieving group fairness in Federated Learning (FL) is challenging because mitigating bias inherently requires using the sensitive attribute values of all clients, while FL is aimed precisely at protecting privacy by not giving access to the clients' data. As we show in this paper, this conflict between fairness and privacy in FL can be resolved by combining FL with Secure Multiparty Computation (MPC) and Differential Privacy (DP). In doing so, we propose a method for training group-fair ML models in cross-device FL under complete and formal privacy guarantees, without requiring the clients to disclose their sensitive attribute values.

研究动机与目标

  • 为解决联邦学习中群体公平与数据隐私之间的固有冲突,即公平性需要访问敏感属性,但隐私又禁止数据共享。
  • 设计一种解决方案,实现在跨设备联邦学习中训练公平模型,而不会暴露单个客户端的敏感属性值。
  • 通过 MPC 与 DP 的结合,提供形式化的隐私保障,确保既不泄露原始数据,也不泄露聚合统计信息。
  • 与现有基于本地差分隐私的公平性方法相比,提升模型效用,后者通常面临显著的准确率下降问题。
  • 在真实联邦学习设置下,于真实世界数据集上展示该方法的可行性与可扩展性。

提出的方法

  • 该框架使用 MPC 协议,安全计算并聚合客户端之间的标签与敏感属性分布统计信息,而无需暴露个体数据。
  • 采用基于 MPC 的安全计算生成拉普拉斯噪声以实现差分隐私,从而在不暴露原始数据的前提下实现可信协调者角色。
  • 引入两个组件:PrivFairFL-Pre 通过 MPC 实现隐私保护的数据重加权,PrivFairFL-Post 通过 MPC 保护的公平性度量实现公平阈值校准。
  • 通过 MPC 与 DP 同时保护客户端更新与聚合统计信息,实现端到端隐私保障,且无需不可信的中心聚合器。
  • MPC 协议使用 SPDZ 和 Replicated2k 等安全多方计算框架实现,支持诚实多数与恶意多数设置。
  • 该方法可集成至标准联邦学习训练流程,在安全聚合后应用基于公平性的数据重加权或阈值调整。

实验结果

研究问题

  • RQ1如何在不损害客户端数据隐私的前提下,实现在跨设备联邦学习中的群体公平?
  • RQ2MPC 与 DP 能否有效结合,以提供形式化隐私保障,同时支持联邦学习中的公平模型训练?
  • RQ3PrivFairFL 的效用与现有基于本地 DP 的公平性方法相比如何,体现在准确率与公平性度量上?
  • RQ4MPC 驱动的公平性框架在不同客户端数量与计算参与方数量下的计算可扩展性如何?
  • RQ5与基线方法相比,所提出的 MPC+DP 方法是否能降低联邦学习中的公平性-效用权衡?

主要发现

  • 在 ADS 数据集上,PrivFairFL-Post 实现了最佳公平性表现,其人口均等差异(ΔSP)为 0.001,等机会差异(ΔEODD)为 0.005,显著优于其他方法。
  • 在 ML-1M 数据集上,PrivFairFL-Post 实现了 0.006 的公平性差距(|1 - DI|),所有方法中最低,表明公平性表现优异且差异极小。
  • 在 ADS 数据集上,PrivFairFL-Post 的模型准确率达到 85.17%,优于 FL-DP-SGD 基线(83.52%),并匹配非私有集中式学习的性能(85.81%)。
  • PrivFairFL-Pre 在 ADS 上实现公平性差距(|1 - DI|)为 0.122,在 ML-1M 上为 0.045,展示了在极小准确率损失下有效缓解偏差的能力。
  • 该框架在 75–109 个客户端下表现出良好可扩展性,在 3PC 诚实多数设置下,PrivFairFL-Post 运行时间低于 10 分钟,显示出实际可行性。
  • PrivFairFL 在公平性与效用两方面均优于本地 DP 基线(Abay et al., 2020),在降低公平性差距的同时保持更高模型准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。