[论文解读] FedDR -- Randomized Douglas-Rachford Splitting Algorithms for Nonconvex Federated Composite Optimization
该论文提出FedDR和asyncFedDR,一种用于非凸联邦复合优化的新型随机化块坐标Douglas-Rachford分裂算法。通过将非凸DR分裂与部分用户参与及异步更新相结合,该方法实现了$Ó(\varepsilon^{-2})$的通信复杂度——与理论下界匹配——同时处理统计异质性与系统异质性、光滑凸正则项以及非精确的近端计算。
We develop two new algorithms, called, FedDR and asyncFedDR, for solving a fundamental nonconvex composite optimization problem in federated learning. Our algorithms rely on a novel combination between a nonconvex Douglas-Rachford splitting method, randomized block-coordinate strategies, and asynchronous implementation. They can also handle convex regularizers. Unlike recent methods in the literature, e.g., FedSplit and FedPD, our algorithms update only a subset of users at each communication round, and possibly in an asynchronous manner, making them more practical. These new algorithms can handle statistical and system heterogeneity, which are the two main challenges in federated learning, while achieving the best known communication complexity. In fact, our new algorithms match the communication complexity lower bound up to a constant factor under standard assumptions. Our numerical experiments illustrate the advantages of our methods over existing algorithms on synthetic and real datasets.
研究动机与目标
- 通过在每轮通信中支持部分用户参与,缓解联邦学习中的通信瓶颈与系统异质性问题。
- 克服现有方法(如FedSplit和FedPD)的局限性,后者要求全部用户参与,在实际场景中不够实用。
- 构建一个可扩展且鲁棒的非凸联邦复合优化框架,支持凸正则项与非精确近端计算。
- 在标准假设下实现最优通信复杂度,同时在异质环境中保持收敛性保证。
- 支持异步更新,以提升系统鲁棒性并减少因慢速节点或网络条件波动导致的空闲时间。
提出的方法
- 提出FedDR,一种用于联邦设置下非凸复合优化的随机化块坐标Douglas-Rachford分裂算法。
- 在每轮通信中引入随机用户选择机制,以降低通信开销并提升可扩展性。
- 在服务器端聚合时采用近端梯度步骤处理正则项,区别于标准平均方法,从而更好地处理约束与正则化。
- 提出asyncFedDR作为异步变体,允许用户独立更新,并以非规则间隔发送更新。
- 通过调整学习率与本地训练轮次的SGD,高效近似近端算子,实现非精确近端计算。
- 在标准假设下(如梯度有界、梯度Lipschitz连续)保持收敛性保证。
实验结果
研究问题
- RQ1随机化块坐标Douglas-Rachford分裂方法能否在部分用户参与的非凸联邦学习中实现最优通信复杂度?
- RQ2在统计异质性与系统异质性下,所提出的FedDR算法相较于FedAvg、FedProx、FedSplit与FedPD的表现如何?
- RQ3异步变体asyncFedDR在真实网络条件下是否能保持与FedDR相同的收敛速度与通信复杂度?
- RQ4通过SGD实现的非精确近端计算在多大程度上可近似精确近端算子,而不会损害收敛性能?
- RQ5用户采样规模如何影响通信效率与模型收敛性(以传输字节数与通信轮次衡量)?
主要发现
- FedDR在寻找驻点时实现$Ó(\varepsilon^{-2})$通信复杂度,与标准假设下的已知理论下界仅相差常数因子。
- 该算法在部分用户参与下仍能保持收敛与性能,而FedSplit与FedPD则需全部参与,表现受限。
- 数值实验表明,FedDR在非独立同分布的合成数据集与FEMNIST数据集上优于FedAvg与FedProx,尤其在高统计异质性下优势更明显。
- 在FEMNIST-62类数据集上,asyncFedDR的损失更低、准确率更高,证明了异步机制在真实场景中的优势。
- 以总通信成本(字节)衡量时,性能在不同用户采样规模下保持稳定,表明对客户端选择具有鲁棒性。
- 调节本地SGD的学习率与本地训练轮次对平衡近端计算的非精确性与本地计算成本至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。