[论文解读] "You Can't Fix What You Can't Measure": Privately Measuring Demographic Performance Disparities in Federated Learning
本文提出了一种局部差分隐私(LDP)机制,用于在不损害用户隐私的前提下测量联邦学习中的群体性能差异。结果表明,在合理的客户端数量下,这些机制在强隐私保障下仍能实现较低的测量误差,从而在仅有限访问敏感人口统计信息的情况下,仍能检测到不同群体间模型性能的不公平性。
As in traditional machine learning models, models trained with federated learning may exhibit disparate performance across demographic groups. Model holders must identify these disparities to mitigate undue harm to the groups. However, measuring a model's performance in a group requires access to information about group membership which, for privacy reasons, often has limited availability. We propose novel locally differentially private mechanisms to measure differences in performance across groups while protecting the privacy of group membership. To analyze the effectiveness of the mechanisms, we bound their error in estimating a disparity when optimized for a given privacy budget. Our results show that the error rapidly decreases for realistic numbers of participating clients, demonstrating that, contrary to what prior work suggested, protecting privacy is not necessarily in conflict with identifying performance disparities of federated models.
研究动机与目标
- 解决在群体成员身份数据具有隐私敏感性时,检测联邦学习模型在不同人口群体间性能差异的挑战。
- 调和在跨设备联邦学习中识别不公平模型性能与保护人口统计属性隐私之间的冲突目标。
- 设计高效、局部差分隐私的机制,以估计性能差距,同时最小化隐私预算的使用。
- 在不同隐私预算、客户端数量和群体规模下,评估这些机制的理论与经验误差边界。
- 使模型持有者或监管机构能够在不依赖中心聚合器协作或访问原始人口统计数据的情况下检测性能差异。
提出的方法
- 提出新颖的局部可微分差分隐私(LDP)机制,专为测量联邦学习中的性能差异而设计,特别注重保护群体成员身份信息。
- 将广义随机响应(GRR)机制适配用于扰动人口统计属性和性能指标,以确保ε-LDP。
- 引入一种性能差距估计框架,利用客户端提供的扰动数据计算不同人口群体间模型准确率的差异。
- 使用切比雪夫不等式推导性能差距估计的理论误差边界,分析隐私(ε)与估计精度之间的权衡。
- 在全局隐私约束下,对不同群体优化隐私预算分配,以最小化估计误差,从而在群体规模不平衡时提升实用性。
- 在真实世界模拟的联邦学习部署中对边界进行经验验证,结果表明实际误差通常低于理论边界上限,表明边界具有保守性。
实验结果
研究问题
- RQ1当群体成员身份数据敏感且必须保护时,能否在不泄露隐私的前提下私密测量联邦学习模型的性能差异?
- RQ2在LDP机制中,估计性能差距的误差如何随参与客户端数量和所选隐私预算(ε)的变化而变化?
- RQ3LDP机制能否实现足够低的估计误差,以在真实世界的联邦学习部署中检测出有意义的性能差异?
- RQ4与先前方法相比,该方法在隐私-效用权衡方面表现如何,特别是在与SMPC或非私有方法的对比中?
- RQ5这些机制是否无需聚合器的协作即可部署,从而支持去中心化的公平性监控?
主要发现
- 所提出的LDP机制即使在中等隐私预算下,也能对性能差异实现较低的测量误差,尤其在参与客户端数量较多时表现更优。
- 使用切比雪夫不等式推导的理论误差边界显示,随着客户端数量增加,误差迅速下降,表明具有良好的可扩展性。
- 在真实世界模拟的联邦学习部署中进行的经验评估表明,实际测量误差显著低于理论边界上限,说明边界具有保守性。
- 这些机制在确保强ε-LDP保障的同时,仍能实现对性能差异的准确检测,证明隐私保护与公平性测量并非本质冲突。
- 对不同群体优化隐私预算分配可降低估计误差,尤其在群体规模不平衡时,显著提升公平性监控的准确性。
- 该方法使模型持有者或监管机构能够在不访问原始人口统计数据的情况下检测性能差异,支持在生产级分布式联邦学习系统中实现隐私保护的公平性审计。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。