Skip to main content
QUICK REVIEW

[论文解读] Bias-Free FedGAN: A Federated Approach to Generate Bias-Free Datasets

Vaikkunth Mugunthan, Vignesh Gokul|arXiv (Cornell University)|Mar 17, 2021
Generative Adversarial Networks and Image Synthesis参考文献 16被引用 7
一句话总结

本文提出 Bias-Free FedGAN,一种联邦生成对抗网络框架,通过聚合器从客户端模型生成元数据,并基于此平衡的合成数据重新训练全局模型,从而消除合成数据生成中的偏差。该方法在非独立同分布(non-iid)数据分布下实现了无偏差的图像合成,同时保持与 FedGAN 相同的通信效率,已在 MNIST 和 FashionMNIST 数据集上得到验证。

ABSTRACT

Federated Generative Adversarial Network (FedGAN) is a communication-efficient approach to train a GAN across distributed clients without clients having to share their sensitive training data. In this paper, we experimentally show that FedGAN generates biased data points under non-independent-and-identically-distributed (non-iid) settings. Also, we propose Bias-Free FedGAN, an approach to generate bias-free synthetic datasets using FedGAN. Our approach generates metadata at the aggregator using the models received from clients and retrains the federated model to achieve bias-free results for image synthesis. Bias-Free FedGAN has the same communication cost as that of FedGAN. Experimental results on image datasets (MNIST and FashionMNIST) validate our claims.

研究动机与目标

  • 解决在非独立同分布(non-iid)数据分布下联邦 GAN 中的偏差问题,特别是当少数类数据在生成结果中代表性不足时。
  • 开发一种通信高效的解决方案,在保护数据隐私的同时,实现在异构客户端上的合成数据生成公平性。
  • 证明基于客户端生成器衍生的元数据重新训练全局模型,可有效缓解偏差,而无需访问原始客户端数据。
  • 在真实非独立同分布设置下,于标准图像基准(MNIST 和 FashionMNIST)上验证所提方法的有效性。
  • 为联邦学习环境中隐私保护、公平的生成建模奠定基础。

提出的方法

  • 在每次联邦训练轮次后,聚合器从所有客户端收集本地生成器模型。
  • 聚合器通过从每个客户端的生成器采样 10,000 张图像,生成一个合成数据集(元数据),构建出一个平衡的全局合成数据集。
  • 将全局生成器和判别器在该聚合元数据上联合训练 100 个周期,以重新校准模型并减少偏差。
  • 将重新训练后的全局模型广播回客户端,用于下一轮联邦训练。
  • 该方法保持了 FedGAN 的通信效率,因为仅交换模型权重,不传输原始数据。
  • 该方法利用模型平均与基于元数据的再训练,以对抗联邦聚合过程中传播的类别不平衡问题。

实验结果

研究问题

  • RQ1当客户端持有非独立同分布(non-i.i.d.)数据分布时,FedGAN 是否会产生偏向合成数据,特别是当少数类数据代表性不足时?
  • RQ2联邦 GAN 框架能否在不共享原始客户端数据或修改客户端训练过程的前提下,生成无偏差的合成图像?
  • RQ3基于客户端生成器衍生的合成元数据重新训练全局模型,是否能有效降低最终输出中的偏差?
  • RQ4与标准 FedGAN 相比,所提出的偏差缓解方法的通信成本如何?
  • RQ5在非独立同分布设置下,所提方法在类别覆盖度和图像质量方面与 FedGAN 相比表现如何?

主要发现

  • 在非独立同分布(non-iid)设置下,FedGAN 产生高度偏向的输出,即使客户端数据中存在少数类,其生成图像也主要来自多数类。
  • 当一个客户端持有 10,000 张少数类 0 的图像(MNIST),而其他客户端持有 10,000 张多数类 2–9 的图像时,FedGAN 仅生成多数类图像,完全忽略类 0。
  • 即使总数据量相等(10,000 个少数类 vs. 10,000 个多数类),FedGAN 仍偏向多数类,表明客户端数据中的类别不平衡会传播至全局模型。
  • Bias-Free FedGAN 能够成功生成来自少数类和多数类的图像,包括在多少数类场景下的类 0 和类 1,如图 3(c)、3(f)、4(c) 和 4(f) 所示。
  • 所提方法保持与 FedGAN 相同的通信成本,因为仅交换模型权重,未传输任何原始数据。
  • 基于客户端生成器衍生的合成元数据重新训练全局模型,能有效恢复类别平衡并提升公平性,且不损害模型质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。