[论文解读] Towards Fair Federated Learning with Zero-Shot Data Augmentation
本文提出 Fed-ZDAC 和 Fed-ZDAS 两种联邦学习框架,利用零样本数据生成技术缓解统计异质性问题,并通过在客户端或服务器端合成低资源类别数据来提升公平性。实验表明,两种方法均显著降低了客户端之间的准确率方差,同时在 MNIST、Fashion-MNIST 和 CIFAR-10 上提升了全局测试准确率。
Federated learning has emerged as an important distributed learning paradigm, where a server aggregates a global model from many client-trained models while having no access to the client data. Although it is recognized that statistical heterogeneity of the client local data yields slower global model convergence, it is less commonly recognized that it also yields a biased federated global model with a high variance of accuracy across clients. In this work, we aim to provide federated learning schemes with improved fairness. To tackle this challenge, we propose a novel federated learning system that employs zero-shot data augmentation on under-represented data to mitigate statistical heterogeneity and encourage more uniform accuracy performance across clients in federated networks. We study two variants of this scheme, Fed-ZDAC (federated learning with zero-shot data augmentation at the clients) and Fed-ZDAS (federated learning with zero-shot data augmentation at the server). Empirical results on a suite of datasets demonstrate the effectiveness of our methods on simultaneously improving the test accuracy and fairness.
研究动机与目标
- 为解决非独立同分布客户端数据分布中统计异质性导致的公平性下降问题。
- 缓解低资源类别客户端与多数类别客户端之间的性能差异。
- 开发一种隐私保护方法,通过不访问原始客户端数据即可生成合成数据。
- 评估零样本数据增强的时机与位置(客户端 vs. 服务器端)对模型公平性与准确率的影响。
- 为所提出的数据增强机制提供差分隐私分析。
提出的方法
- 利用仅基于模型统计信息而非原始数据的零样本数据生成(ZSDG)技术,合成低资源类别的图像。
- 部署两种变体:Fed-ZDAC(在客户端生成)和 Fed-ZDAS(在服务器端生成),以提升本地模型泛化能力。
- 采用可微分的生成模型,通过反转客户端或服务器端的模型权重,为少数类别生成伪样本。
- 使用标准的 ResNet34 架构进行基线训练,并在不同数据分布设置下评估模型反演质量。
- 在数据增强前引入预热阶段,以确保模型性能足够高,从而生成高质量的合成数据。
- 通过 $(0,\delta)$-差分隐私分析,证明该方法能够保护客户端数据隐私。
实验结果
研究问题
- RQ1在客户端或服务器端进行零样本数据增强,如何影响非独立同分布联邦学习中的公平性与准确率?
- RQ2在联邦训练中,何时启动数据增强可最大化公平性与模型性能?
- RQ3合成数据的质量如何依赖于底层模型的性能,特别是在非独立同分布数据分布下?
- RQ4零样本数据生成是否能在不访问原始客户端数据的前提下提升模型泛化能力,从而实现隐私保护?
- RQ5Fed-ZDAC 与 Fed-ZDAS 在减少数据不平衡客户端之间的准确率方差方面表现如何?
主要发现
- Fed-ZDAC 与 Fed-ZDAS 在 CIFAR-10 等非独立同分布数据集上,均将客户端之间的准确率方差降低高达 50%,显著提升了公平性。
- 在 CIFAR-10 上,使用 Fed-ZDAC 训练的模型在非独立同分布设置下达到 73.96% 的测试准确率,显著优于基线联邦学习方法。
- 通过模型反演生成的合成数据质量随模型性能下降而降低,最差性能(58.10% 准确率)出现在高度非独立同分布的数据分布下。
- 在第 90 或 95 轮开始数据增强,比更早启动(如第 80 轮)更具公平性优势,因为更高的模型准确率可生成更高质量的合成数据。
- 该方法满足 $(0,\delta)$-差分隐私,证实合成数据生成不会损害客户端数据隐私。
- 从 Fed-ZDAC 和 Fed-ZDAS 生成的合成数据能有效减少本地数据分布差异,提升低资源类别的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。