[论文解读] Bias-Free FedGAN: A Federated Approach to Generate Bias-Free Datasets
本文提出 Bias-Free FedGAN,一种联邦生成对抗网络框架,通过聚合器从客户端模型生成元数据,并基于此平衡的合成数据重新训练全局模型,从而消除合成数据生成中的偏差。该方法在非独立同分布(non-iid)数据分布下实现了无偏差的图像合成,同时保持与 FedGAN 相同的通信效率,已在 MNIST 和 FashionMNIST 数据集上得到验证。
Federated Generative Adversarial Network (FedGAN) is a communication-efficient approach to train a GAN across distributed clients without clients having to share their sensitive training data. In this paper, we experimentally show that FedGAN generates biased data points under non-independent-and-identically-distributed (non-iid) settings. Also, we propose Bias-Free FedGAN, an approach to generate bias-free synthetic datasets using FedGAN. Our approach generates metadata at the aggregator using the models received from clients and retrains the federated model to achieve bias-free results for image synthesis. Bias-Free FedGAN has the same communication cost as that of FedGAN. Experimental results on image datasets (MNIST and FashionMNIST) validate our claims.
研究动机与目标
- 解决在非独立同分布(non-iid)数据分布下联邦 GAN 中的偏差问题,特别是当少数类数据在生成结果中代表性不足时。
- 开发一种通信高效的解决方案,在保护数据隐私的同时,实现在异构客户端上的合成数据生成公平性。
- 证明基于客户端生成器衍生的元数据重新训练全局模型,可有效缓解偏差,而无需访问原始客户端数据。
- 在真实非独立同分布设置下,于标准图像基准(MNIST 和 FashionMNIST)上验证所提方法的有效性。
- 为联邦学习环境中隐私保护、公平的生成建模奠定基础。
提出的方法
- 在每次联邦训练轮次后,聚合器从所有客户端收集本地生成器模型。
- 聚合器通过从每个客户端的生成器采样 10,000 张图像,生成一个合成数据集(元数据),构建出一个平衡的全局合成数据集。
- 将全局生成器和判别器在该聚合元数据上联合训练 100 个周期,以重新校准模型并减少偏差。
- 将重新训练后的全局模型广播回客户端,用于下一轮联邦训练。
- 该方法保持了 FedGAN 的通信效率,因为仅交换模型权重,不传输原始数据。
- 该方法利用模型平均与基于元数据的再训练,以对抗联邦聚合过程中传播的类别不平衡问题。
实验结果
研究问题
- RQ1当客户端持有非独立同分布(non-i.i.d.)数据分布时,FedGAN 是否会产生偏向合成数据,特别是当少数类数据代表性不足时?
- RQ2联邦 GAN 框架能否在不共享原始客户端数据或修改客户端训练过程的前提下,生成无偏差的合成图像?
- RQ3基于客户端生成器衍生的合成元数据重新训练全局模型,是否能有效降低最终输出中的偏差?
- RQ4与标准 FedGAN 相比,所提出的偏差缓解方法的通信成本如何?
- RQ5在非独立同分布设置下,所提方法在类别覆盖度和图像质量方面与 FedGAN 相比表现如何?
主要发现
- 在非独立同分布(non-iid)设置下,FedGAN 产生高度偏向的输出,即使客户端数据中存在少数类,其生成图像也主要来自多数类。
- 当一个客户端持有 10,000 张少数类 0 的图像(MNIST),而其他客户端持有 10,000 张多数类 2–9 的图像时,FedGAN 仅生成多数类图像,完全忽略类 0。
- 即使总数据量相等(10,000 个少数类 vs. 10,000 个多数类),FedGAN 仍偏向多数类,表明客户端数据中的类别不平衡会传播至全局模型。
- Bias-Free FedGAN 能够成功生成来自少数类和多数类的图像,包括在多少数类场景下的类 0 和类 1,如图 3(c)、3(f)、4(c) 和 4(f) 所示。
- 所提方法保持与 FedGAN 相同的通信成本,因为仅交换模型权重,未传输任何原始数据。
- 基于客户端生成器衍生的合成元数据重新训练全局模型,能有效恢复类别平衡并提升公平性,且不损害模型质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。