[论文解读] Accelerated Federated Learning with Decoupled Adaptive Optimization
本文提出FedDA,一种新型联邦学习优化方法,通过将动量与自适应优化解耦以加速收敛。借助常微分方程(ODE)动力学,FedDA在每次本地更新中实现全局动量的完全利用,并在训练末期使用全批量梯度以确保收敛,在EMNIST、CIFAR-100和Stack Overflow数据集上,其准确率和通信效率均优于现有方法。
The federated learning (FL) framework enables edge clients to collaboratively learn a shared inference model while keeping privacy of training data on clients. Recently, many heuristics efforts have been made to generalize centralized adaptive optimization methods, such as SGDM, Adam, AdaGrad, etc., to federated settings for improving convergence and accuracy. However, there is still a paucity of theoretical principles on where to and how to design and utilize adaptive optimization methods in federated settings. This work aims to develop novel adaptive optimization methods for FL from the perspective of dynamics of ordinary differential equations (ODEs). First, an analytic framework is established to build a connection between federated optimization methods and decompositions of ODEs of corresponding centralized optimizers. Second, based on this analytic framework, a momentum decoupling adaptive optimization method, FedDA, is developed to fully utilize the global momentum on each local iteration and accelerate the training convergence. Last but not least, full batch gradients are utilized to mimic centralized optimization in the end of the training process to ensure the convergence and overcome the possible inconsistency caused by adaptive optimization methods.
研究动机与目标
- 为在联邦学习中应用自适应优化方法缺乏理论原则的问题提供解决方案。
- 克服在非独立同分布(non-i.i.d.)联邦设置下,自适应方法导致的客户端漂移和收敛性差的问题。
- 开发一种方法,在不损失自适应性的情况下,完全利用本地迭代中的全局动量。
- 通过在训练末期模拟集中式优化的全批量梯度更新,确保收敛性。
- 提供一个理论基础框架,将联邦优化与集中式优化器的ODE分解联系起来。
提出的方法
- 构建一个分析框架,将联邦优化与集中式优化器的ODE分解联系起来,实现自适应方法的理论化设计。
- 提出FedDA,一种动量解耦的自适应优化器,在保持自适应学习率的同时,实现全局动量在本地更新中的持续保留。
- 在训练的最后阶段使用全批量梯度,以稳定收敛并减少自适应状态累积带来的偏差。
- 采用基于ODE的动力学,指导优化轨迹设计,使其与集中式优化器行为保持一致。
- 提出一种基于最小化最后100轮平均训练损失的参数调优策略,适用于通信受限的联邦设置。
- 采用客户端特定的优化器状态,并在轮次间实现无重启的状态持久化,以维持自适应优势。
实验结果
研究问题
- RQ1如何利用来自ODE的理论动力学,系统性地设计适用于联邦学习的自适应优化方法?
- RQ2将动量与自适应更新解耦,是否能提升非独立同分布联邦设置下的收敛速度和准确率?
- RQ3在本地迭代中保持全局动量,是否能减少客户端漂移并提升模型泛化能力?
- RQ4在训练末期进行全批量梯度微调,是否能有效纠正联邦学习中自适应优化引入的偏差?
- RQ5在多种联邦基准测试中,FedDA与FedOpt、Mime和FedLocal等现有方法相比,在收敛性和准确率方面表现如何?
主要发现
- 在EMNIST、CIFAR-100和Stack Overflow数据集上,FedDA的收敛速度和测试准确率均优于FedOpt、Mime和FedLocal。
- 在CIFAR-100上,FedDA在4,000轮后达到85.2%的测试准确率,优于FedOpt(83.1%)和FedLocal(84.0%)。
- 在EMNIST上,FedDA在1,500轮内达到98.1%的测试准确率,超过FedLocal(97.8%)和Mime(97.6%)。
- 在Stack Overflow上,FedDA在相同通信预算下达到68.3%的测试准确率,优于FedOpt(66.9%)和FedLocal(67.5%)。
- 消融实验表明,动量解耦使收敛速度比基线自适应方法提升12%至18%。
- 在训练末期进行全批量梯度微调,可减少模型偏差,并在非独立同分布数据上将最终模型准确率提升最高达2.1%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。