[论文解读] Federated Composite Optimization
本文提出联邦对偶平均(FedDualAvg),一种用于联邦复合优化(FCO)的新颖原始-对偶算法,解决了非光滑、正则化联邦学习(FL)设置中‘原始平均的诅咒’问题。通过在服务器端使用对偶平均而非原始平均,FedDualAvg 保持了稀疏性和约束条件,实现了与集中式基线相当的收敛速率,同时在理论和实践中均优于 FedAvg 和 FedMiD。
Federated Learning (FL) is a distributed learning paradigm that scales on-device learning collaboratively and privately. Standard FL algorithms such as FedAvg are primarily geared towards smooth unconstrained settings. In this paper, we study the Federated Composite Optimization (FCO) problem, in which the loss function contains a non-smooth regularizer. Such problems arise naturally in FL applications that involve sparsity, low-rank, monotonicity, or more general constraints. We first show that straightforward extensions of primal algorithms such as FedAvg are not well-suited for FCO since they suffer from the "curse of primal averaging," resulting in poor convergence. As a solution, we propose a new primal-dual algorithm, Federated Dual Averaging (FedDualAvg), which by employing a novel server dual averaging procedure circumvents the curse of primal averaging. Our theoretical analysis and empirical experiments demonstrate that FedDualAvg outperforms the other baselines.
研究动机与目标
- 为解决标准联邦平均(FedAvg)及其扩展在处理联邦学习应用中常见的非光滑正则化项时的局限性。
- 识别并解决‘原始平均的诅咒’问题——即在基于原始的联邦学习算法中,服务器端的平均操作会破坏正则化模型的稀疏性。
- 开发一种新算法,在保持联邦学习(隐私性、通信效率)优势的同时,支持非光滑正则化项,如 ℓ₁、核范数或约束条件。
- 对理论收敛性进行分析,并在真实联邦数据集(包括带有 ℓ₁ 正则化的 fMRI 数据)上进行实证验证。
提出的方法
- 提出联邦对偶平均(FedDualAvg),一种原始-对偶算法,通过在服务器端使用对偶平均过程替代标准的原始平均,以保留正则化效果。
- 在客户端使用本地对偶平均,采用较小的客户端学习率 η_c,以确保本地更新的稳定性和准确性。
- 在服务器端采用对偶平均更新,将梯度在对偶空间中聚合,避免对原始模型状态进行破坏性平均。
- 理论分析利用正则化对偶间隙(tilde{D}_{h})以及次梯度和模型偏差项的有界性,建立收敛性。
- 通过学习率调度控制误差项,并有界化本地与全局迭代点之间的期望偏差,推导收敛速率。
- 通过令 η_c → 0 时的极限和对模型偏差项的统一有界性,引入一种新颖的稳定性条件,以确保收敛。
实验结果
研究问题
- RQ1标准 FedAvg 及其基于原始的变体(如 FedMiD)能否在联邦设置中有效优化非光滑正则化目标?
- RQ2为何原始平均在具有非光滑正则化项的联邦学习中会失效,无法保持稀疏性或约束条件?
- RQ3在服务器端采用对偶平均策略是否能缓解‘原始平均的诅咒’,并提升复合目标的收敛性能?
- RQ4在存在非光滑正则化项的情况下,能否为联邦原始-对偶算法建立理论收敛保证?
- RQ5FedDualAvg 在带有 ℓ₁ 正则化的实际联邦数据集上,与 FedAvg、FedMiD 及集中式基线相比,实证表现如何?
主要发现
- FedDualAvg 在带有 ℓ₁ 正则化的联邦 fMRI 数据集上实现了与集中式训练相当的性能,且无需共享原始客户端数据。
- FedDualAvg 显著优于本地基线(单客户端训练)和使用次梯度的 FedAvg,展现出更优的收敛性和稀疏性保持能力。
- 实证结果表明,FedDualAvg 在客户端和服务器端均保持了稀疏性,避免了 FedMiD 中因原始平均导致的密集解。
- 理论分析确认,FedDualAvg 在非光滑目标下以 O(1/√T) 的速率收敛,当满足适当条件时,与集中式方法收敛速率一致。
- 该算法对客户端异构性和通信约束具有鲁棒性,误差项通过学习率控制和对偶平均得到有界化。
- 该方法能有效处理多种正则化项,包括 ℓ₁、核范数以及指示约束的特征函数,显著拓展了其在生物医学和低秩联邦学习任务中的适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。