Skip to main content
QUICK REVIEW

[论文解读] Layer-wise Adaptive Model Aggregation for Scalable Federated Learning

Sunwoo Lee, Tuo Zhang|arXiv (Cornell University)|Oct 19, 2021
Privacy-Preserving Technologies in Data被引用 6
一句话总结

该论文提出FedLAMA,一种用于联邦学习的逐层自适应模型聚合方法,可根据各层的模型差异和通信成本动态调整每层的聚合间隔。通过优先对差异较大的层进行频繁同步,并推迟对稳定层的更新,FedLAMA在保持最小精度损失的前提下显著降低了通信开销,在不同非独立同分布(non-IID)数据设置下优于周期性全模型聚合。

ABSTRACT

In Federated Learning, a common approach for aggregating local models across clients is periodic averaging of the full model parameters. It is, however, known that different layers of neural networks can have a different degree of model discrepancy across the clients. The conventional full aggregation scheme does not consider such a difference and synchronizes the whole model parameters at once, resulting in inefficient network bandwidth consumption. Aggregating the parameters that are similar across the clients does not make meaningful training progress while increasing the communication cost. We propose FedLAMA, a layer-wise model aggregation scheme for scalable Federated Learning. FedLAMA adaptively adjusts the aggregation interval in a layer-wise manner, jointly considering the model discrepancy and the communication cost. The layer-wise aggregation method enables to finely control the aggregation interval to relax the aggregation frequency without a significant impact on the model accuracy. Our empirical study shows that FedLAMA reduces the communication cost by up to 60% for IID data and 70% for non-IID data while achieving a comparable accuracy to FedAvg.

研究动机与目标

  • 为解决联邦学习中周期性全模型聚合的低效问题,即所有层均以统一方式同步,尽管客户端间各层的模型差异程度各不相同。
  • 通过最小化客户端间相似参数的冗余同步,在带宽受限的联邦学习环境中降低通信成本。
  • 通过仅对差异较低的层选择性地增加聚合间隔,从而在不造成显著性能下降的前提下,降低同步频率,同时保持模型收敛性和精度。
  • 提供一种基于原则的、逐层自适应的聚合策略,联合优化通信效率与模型精度。
  • 在多种基准数据集上,针对不同的非I.I.D.数据分布和系统配置,对方法进行实证验证。

提出的方法

  • FedLAMA通过一种新颖的差异度量(基于客户端间梯度范数或参数方差)在运行时估计各层的模型差异。
  • 根据各层对总模型差异的贡献程度对层进行排序,并为差异较低的层分配更长的聚合间隔。
  • 每层的聚合间隔通过因子φ自适应增加,该因子根据层的差异水平与通信成本之间的权衡进行调优。
  • 系统在每个训练阶段仅执行一次全模型同步,之后根据当前的差异估计值更新各层的间隔。
  • 该方法支持与现有压缩技术(如量化、稀疏化)集成,作为互补的通信减少策略。
  • 针对非I.I.D.数据下的平滑非凸问题,提供了理论收敛性分析,证明了在所提出的自适应方案下具有收敛保证。

实验结果

研究问题

  • RQ1在非I.I.D.数据条件下,逐层自适应聚合与周期性全聚合相比,在通信效率和模型精度方面表现如何?
  • RQ2基于各层的聚合间隔策略是否能在不显著降低模型性能的前提下减少通信成本?
  • RQ3在联邦学习环境中,估计各层模型差异的最优方式是什么,以指导自适应聚合?
  • RQ4间隔增加因子φ如何影响不同数据集和数据分布下的收敛性和精度?
  • RQ5该自适应聚合策略是否能在非凸、非I.I.D.的联邦学习设置中保持收敛性保证?

主要发现

  • 随着聚合间隔增加,FedLAMA的精度下降幅度显著小于FedAvg,尤其在CIFAR-100和FEMNIST上,高间隔下精度提升达1.5–2%。
  • 在CIFAR-10上,100%客户端参与且Dirichlet系数为0.1时,FedLAMA在φ=1(基线)下τ′=6时达到89.52%精度,而FedAvg在τ′=24时降至84.82%。
  • 在25%客户端活跃且Dirichlet系数为0.1时,FedLAMA在τ′=12时保持86.07%精度,而FedAvg在τ′=24时降至76.72%。
  • 在CIFAR-100上,100%客户端参与且Dirichlet系数为0.1时,FedLAMA在τ′=6时达到79.78%精度,而FedAvg在τ′=24时降至69.63%。
  • 在FEMNIST上,50%客户端活跃且φ=1时,FedLAMA达到86.59%精度,优于FedAvg在τ′=12时的85.74%。
  • 该方法在不同数据异构性水平下表现出鲁棒性,即使在高非I.I.D.设置(Dirichlet系数0.1)下也保持一致的性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。