Skip to main content
QUICK REVIEW

[论文解读] FedShuffle: Recipes for Better Use of Local Work in Federated Learning

Samuel Horváth, Maziar Sanjabi|arXiv (Cornell University)|Apr 27, 2022
Privacy-Preserving Technologies in Data被引用 6
一句话总结

FedShuffle 提出了一种新颖的联邦学习框架,通过整合随机重排、数据不平衡处理和客户端采样,提升了本地更新的利用率——在这些现实条件下首次提供了理论收敛保证。它解决了 FedAvg 中的客观不一致问题,并在部分参与和异构数据条件下优于 FedNova 和带动量的 FedAvg。

ABSTRACT

The practice of applying several local updates before aggregation across clients has been empirically shown to be a successful approach to overcoming the communication bottleneck in Federated Learning (FL). Such methods are usually implemented by having clients perform one or more epochs of local training per round while randomly reshuffling their finite dataset in each epoch. Data imbalance, where clients have different numbers of local training samples, is ubiquitous in FL applications, resulting in different clients performing different numbers of local updates in each round. In this work, we propose a general recipe, FedShuffle, that better utilizes the local updates in FL, especially in this regime encompassing random reshuffling and heterogeneity. FedShuffle is the first local update method with theoretical convergence guarantees that incorporates random reshuffling, data imbalance, and client sampling - features that are essential in large-scale cross-device FL. We present a comprehensive theoretical analysis of FedShuffle and show, both theoretically and empirically, that it does not suffer from the objective function mismatch that is present in FL methods that assume homogeneous updates in heterogeneous FL setups, such as FedAvg (McMahan et al., 2017). In addition, by combining the ingredients above, FedShuffle improves upon FedNova (Wang et al., 2020), which was previously proposed to solve this mismatch. Similar to Mime (Karimireddy et al., 2020), we show that FedShuffle with momentum variance reduction (Cutkosky & Orabona, 2019) improves upon non-local methods under a Hessian similarity assumption.

研究动机与目标

  • 解决由于数据不平衡导致客户端执行不同数量本地更新而引起的联邦学习中的客观不一致问题。
  • 为在现实联邦学习设置下(包括随机重排、数据异构性和客户端采样)的本地更新方法提供理论收敛保证。
  • 通过引入随机重排和对不完整本地训练轮次的更好处理,改进 FedNova。
  • 实现无状态、可扩展的联邦优化,适用于包含数百万台设备的大规模跨设备联邦学习。
  • 在 Hessian 相似性假设下,统一动量方差减少与重排及异构更新,以提升收敛性。

提出的方法

  • 提出 FedShuffle,一种在每个本地周期对客户端数据进行随机重排的本地更新方法,确保方差减少并提升收敛性。
  • 设计一种新型聚合规则,考虑每个客户端本地步数的差异,纠正 FedAvg 和 FedNova 中存在的目标不匹配问题。
  • 提出 FedShuffleGen 作为混合变体,结合学习率缩放与更新加权,以处理因系统限制导致的不完整本地轮次。
  • 在 FedShuffle 中引入动量方差减少(Cutkosky & Orabona, 2019),在 Hessian 相似性假设下提升收敛性。
  • 将优化问题表述为与客户端损失加权和,其中客户端权重与数据量成正比,确保全局目标对齐。
  • 实施一种客户端采样策略,每轮仅部分设备参与,反映真实世界跨设备联邦学习的约束。

实验结果

研究问题

  • RQ1是否存在一种联邦学习方法,能够在随机重排、数据不平衡和客户端采样等关键特性下实现理论收敛?这些特性在大规模联邦学习中至关重要。
  • RQ2FedShuffle 如何缓解 FedAvg 和 FedNova 在客户端执行不同数量本地更新时所面临的客观不一致问题?
  • RQ3在异构、非独立同分布(non-iid)联邦学习环境中,将随机重排与动量方差减少相结合是否能提升收敛性?
  • RQ4在部分参与和真实世界数据条件下,FedShuffle 相较于 FedAvg、FedNova 和带动量的 FedAvg 的实际表现如何?
  • RQ5混合聚合策略(FedShuffleGen)是否能有效纠正生产环境类似设置中因不完整本地训练轮次导致的客观不一致问题?

主要发现

  • FedShuffle 在随机重排、数据不平衡和客户端采样条件下实现了理论收敛——这些条件此前在以往的本地更新方法中未被解决。
  • FedShuffle 通过基于本地更新次数动态调整聚合权重,消除了 FedAvg 和 FedNova 中固有的客观不一致问题。
  • 在 Shakespeare 数据集(使用 LSTM)上,FedShuffle 搭配动量在部分参与(每轮 16 个客户端)条件下,收敛速度更快,训练损失更低,优于 FedAvg 和 FedNova。
  • 在 CIFAR100 数据集(使用 ResNet18)上,FedShuffle 搭配动量在验证准确率上优于 FedAvg 和 FedNova,尤其当客户端本地周期随机变化(2–5 个周期)时表现更优。
  • 在二次目标实验中,FedShuffleGen(结合 FedShuffle 与 FedNova 风格聚合)表现出更优性能,并修复了因不完整本地轮次导致的客观不一致问题。
  • 在 FedShuffle 中引入动量方差减少,可在 Hessian 相似性假设下实现更快收敛,其性能在类似设置中达到或超过 Mime。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。