Skip to main content
QUICK REVIEW

[论文解读] Training Fair Models in Federated Learning without Data Privacy Infringement

Che, Xin, Hu, Jingdi|arXiv (Cornell University)|Sep 13, 2021
Privacy-Preserving Technologies in Data参考文献 58被引用 19
一句话总结

该论文提出 FedFair,一种新颖的联邦学习框架,可在不损害数据隐私的前提下,在跨孤岛设置中训练公平的机器学习模型。通过引入一种减少方差的联邦公平性估计方法,FedFair 将公平性约束整合到联邦优化中,在三个真实世界数据集上实现了最先进的公平性-准确率权衡,同时对客户端掉线保持鲁棒性。

ABSTRACT

Training fair machine learning models becomes more and more important. As many powerful models are trained by collaboration among multiple parties, each holding some sensitive data, it is natural to explore the feasibility of training fair models in federated learning so that the fairness of trained models, the data privacy of clients, and the collaboration between clients can be fully respected simultaneously. However, the task of training fair models in federated learning is challenging, since it is far from trivial to estimate the fairness of a model without knowing the private data of the participating parties, which is often constrained by privacy requirements in federated learning. In this paper, we first propose a federated estimation method to accurately estimate the fairness of a model without infringing the data privacy of any party. Then, we use the fairness estimation to formulate a novel problem of training fair models in federated learning. We develop FedFair, a well-designed federated learning framework, which can successfully train a fair model with high performance without data privacy infringement. Our extensive experiments on three real-world data sets demonstrate the excellent fair model training performance of our method.

研究动机与目标

  • 解决在不违反数据隐私的前提下,在跨孤岛联邦学习中训练公平机器学习模型的挑战。
  • 开发一种方法,准确估计分布式客户端之间的模型公平性,而无需暴露私有数据。
  • 制定一种新的联邦优化问题,联合最大化模型准确率和公平性,同时满足隐私约束。
  • 设计一种对客户端掉线具有鲁棒性的联邦学习框架,即使在训练过程中客户端掉线也能保持性能。
  • 通过实证验证所提出方法在多样化真实世界数据集上的公平性-准确率权衡中的优越性。

提出的方法

  • 提出一种联邦估计方法,将公平性度量(如人口均等、机会均等)计算为本地客户端估计的加权平均,以降低估计方差。
  • 使用交替投影梯度法求解联合平衡模型准确率和公平性的约束优化问题,实现联邦化求解。
  • 将源自联邦估计的公平性约束整合到标准联邦损失函数中,支持端到端训练。
  • 采用可微分公平性代理(DGEO)在训练过程中近似公平性度量,支持基于梯度的优化。
  • 通过依赖剩余客户端估计的平均值,设计框架以应对客户端掉线,保持公平性估计的稳定性。
  • 将该方法应用于三个真实世界数据集上的逻辑回归和深度神经网络模型:DRUG、COMPASS 和 ADULT。

实验结果

研究问题

  • RQ1在联邦设置中,是否可以在不暴露私有客户端数据的前提下,准确估计机器学习模型的公平性?
  • RQ2与本地公平性估计相比,联邦公平性估计在准确率和方差方面是否表现更优?
  • RQ3联邦优化框架是否能有效平衡模型准确率和公平性,同时保护数据隐私?
  • RQ4所提出方法在联邦训练过程中对客户端掉线的鲁棒性如何?
  • RQ5与现有基线方法相比,所提出框架是否在真实世界数据集上实现了更优的公平性-准确率权衡?

主要发现

  • FedFair 在所有数据集上均实现了公平性与准确率的最高调和平均值,优于本地优化(LCO)和其他基线方法。
  • 联邦估计方法相比本地估计显著降低了公平性估计的方差,从而实现更稳定、更准确的公平性监控。
  • 在神经网络模型上,较小的 epsilon(更紧的公平性约束)可起到正则化作用,即使在模型复杂度更高的情况下也能提升测试准确率。
  • FedFair 展现出对客户端掉线的强大鲁棒性:即使在 50% 掉线率下,调和平均性能仍保持稳定或仅轻微下降,尤其在 ADULT 等较大数据集上表现更优。
  • 在 ADULT 数据集上,FedFair 在 50% 客户端掉线的情况下仍能保持高性能的调和平均值,表明其在大规模联邦设置中具有极强的抗扰能力。
  • 该方法在无任何数据泄露的情况下实现更优的公平性表现,因为公平性估计完全基于聚合后的非敏感统计信息计算。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。