[论文解读] Mitigating Bias in Federated Learning
本文分析联邦学习中的偏差来源,并提出三种偏差缓解方法——局部再加权、带差分隐私的全局再加权,以及联邦偏见消除——并显示它们在 IID 和非 IID 数据分布下可以在不损害隐私的前提下降低偏差。
As methods to create discrimination-aware models develop, they focus on centralized ML, leaving federated learning (FL) unexplored. FL is a rising approach for collaborative ML, in which an aggregator orchestrates multiple parties to train a global model without sharing their training data. In this paper, we discuss causes of bias in FL and propose three pre-processing and in-processing methods to mitigate bias, without compromising data privacy, a key FL requirement. As data heterogeneity among parties is one of the challenging characteristics of FL, we conduct experiments over several data distributions to analyze their effects on model performance, fairness metrics, and bias learning patterns. We conduct a comprehensive analysis of our proposed techniques, the results demonstrating that these methods are effective even when parties have skewed data distributions or as little as 20% of parties employ the methods.
研究动机与目标
- 识别并分析联邦学习环境中的偏差原因。
- 在不暴露数据隐私的前提下,将集中式的偏差缓解技术应用于 FL。
- 在不同数据异质性条件下提出并评估三种偏差缓解方法。
- 评估 FL 场景中的公平性指标与隐私权衡。
提出的方法
- 分析FL中的偏差原因,包括参与方选择、数据异质性和融合算法。
- 将集中式 ML 的再加权(Reweighing)和偏见移除(Prejudice Remover)在两种隐私保护形式下应用于 FL:局部再加权(预处理)以及带差分隐私的全局再加权(预处理)加上联邦偏见移除(在处理中)。
- 提出三种缓解方法:局部再加权、带 DP 的全局再加权、联邦偏见移除。
- 在 UCI Adult 和 ProPublica Compas 数据集上使用 IID 和非 IID 分区,通过逻辑回归与公平性指标进行评估。
- 与集中基线进行比较,并分析隐私-性能-公平性权衡。
实验结果
研究问题
- RQ1联邦学习中的主要偏差来源是什么?
- RQ2是否可以在不牺牲隐私的前提下将集中式偏差缓解技术应用于 FL?
- RQ3在 IID 和非 IID 数据下,预处理和在处理的偏差缓解方法在 FL 中的有效性如何?
- RQ4部分参与和不同数据分布对偏差缓解在 FL 中效果的影响是什么?
主要发现
- 局部再加权在 IID 设置下可以降低偏差并保持预测准确性。
- 联邦偏见移除在若干指标上降低偏差,但可能以准确性为代价,并且比局部再加权表现更稳定。
- 带差分隐私的全局再加权在 DP 预算内可以缓解偏差;有效性取决于隐私参数 epsilon。
- 部分参与(仅子集参与方)仍然能降低偏差,显示方法对掉线具鲁棒性。
- 在高度不平衡的数据中,只要参与方对两组都具有某些代表性,局部再加权仍然有效;联邦偏见移除的效果不那么一致。
- 在 FL 设置中某些公平性指标可能不可靠,选择指标对评估公平性很重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。