Skip to main content
QUICK REVIEW

[论文解读] Synthetic data shuffling accelerates the convergence of federated learning under data heterogeneity

Bo Li, Yasin Esfandiari|arXiv (Cornell University)|Jun 23, 2023
Privacy-Preserving Technologies in Data参考文献 54被引用 4
一句话总结

该论文提出 Fedssyn 框架,通过在客户端之间混洗本地生成的合成数据,在数据异构性条件下加速联邦学习的收敛。通过理论证明混洗可使梯度差异性呈二次方减少,通信轮次呈超线性减少,Fedssyn 在不违反数据隐私的前提下实现了接近集中式学习的性能。

ABSTRACT

In federated learning, data heterogeneity is a critical challenge. A straightforward solution is to shuffle the clients' data to homogenize the distribution. However, this may violate data access rights, and how and when shuffling can accelerate the convergence of a federated optimization algorithm is not theoretically well understood. In this paper, we establish a precise and quantifiable correspondence between data heterogeneity and parameters in the convergence rate when a fraction of data is shuffled across clients. We prove that shuffling can quadratically reduce the gradient dissimilarity with respect to the shuffling percentage, accelerating convergence. Inspired by the theory, we propose a practical approach that addresses the data access rights issue by shuffling locally generated synthetic data. The experimental results show that shuffling synthetic data improves the performance of multiple existing federated learning algorithms by a large margin.

研究动机与目标

  • 建立数据混洗与联邦学习在数据异构性下收敛速度之间精确、可量化的联系。
  • 通过用本地生成的合成数据替代真实数据,解决数据混洗中的隐私问题。
  • 开发一种与现有联邦学习算法兼容的实用、即插即用框架。
  • 通过实证验证,合成数据混洗可提升多种设置下的收敛速度和模型准确率。

提出的方法

  • 理论分析证明,混洗部分比例为 p 的数据可使梯度差异性呈二次方减少,通信轮次呈超线性减少。
  • 提出 Fedssyn:每个客户端在其数据上训练本地生成器以生成合成样本,随后由服务器对这些样本进行混洗并重新分发。
  • 合成数据混洗仅在训练开始时执行一次,后续训练过程中无需进一步协调或数据传输。
  • 该框架与任何联邦学习算法兼容,且避免真实数据共享,从而保护隐私。
  • 实证评估使用 DDPM 和基于 GAN 的生成器生成合成数据,性能通过 Top-1 准确率和通信轮次进行衡量。
  • 在强凸和非凸(基于 DNN)设置下,验证了理论收敛边界。

实验结果

研究问题

  • RQ1在数据异构性条件下,跨客户端混洗部分数据对 FedAvg 收敛速度的定量影响如何?
  • RQ2合成数据混洗能否在保护数据隐私的前提下复现真实数据混洗的收敛优势?
  • RQ3合成数据的质量和分布匹配对联邦学习性能有何影响?
  • RQ4混洗的合成数据比例如何影响收敛速度中的随机噪声和梯度差异性?
  • RQ5梯度差异性的理论减少是否可转化为通信效率和准确率的可测量提升?

主要发现

  • 混洗比例为 p 的数据可使梯度差异性呈二次方减少,通信轮次呈超线性减少——通信轮次减少的倍数大于 p。
  • 当 p = 0.06 时,Fedssyn 使梯度差异性减少 50%,且 Top-1 准确率相比基线提升 20%。
  • 当 p = 0.5 时,模型的 Top-1 准确率超过 IID 基线,表明在高异构性下已实现接近最优的性能。
  • 有效随机噪声主要由 (1−p)σ² 主导,表明噪声按未混洗部分的比例减少。
  • 实证结果证实,合成数据混洗可使随机噪声和函数差异性同时降低,与理论预测一致。
  • 基于 DDPM 的生成器在生成高质量合成数据以提升联邦学习收敛性方面优于基于 GAN 的替代方案。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。