Skip to main content
QUICK REVIEW

[论文解读] FedNest: Federated Bilevel, Minimax, and Compositional Optimization

Davoud Ataee Tarzanagh, Mingchen Li|arXiv (Cornell University)|May 4, 2022
Stochastic Gradient Optimization Techniques被引用 7
一句话总结

FedNest 提出了一种新颖的联邦优化框架,用于处理双层、极小极大和复合优化问题,通过交替使用随机方差减少和通信高效的超梯度计算。该方法在任意客户端异构性条件下实现了可证明的收敛性,样本复杂度为 $O(\epsilon^{-2})$,与非联邦最先进的方法性能相当。

ABSTRACT

Standard federated optimization methods successfully apply to stochastic problems with single-level structure. However, many contemporary ML problems -- including adversarial robustness, hyperparameter tuning, and actor-critic -- fall under nested bilevel programming that subsumes minimax and compositional optimization. In this work, we propose \fedblo: A federated alternating stochastic gradient method to address general nested problems. We establish provable convergence rates for \fedblo in the presence of heterogeneous data and introduce variations for bilevel, minimax, and compositional optimization. \fedblo introduces multiple innovations including federated hypergradient computation and variance reduction to address inner-level heterogeneity. We complement our theory with experiments on hyperparameter \& hyper-representation learning and minimax optimization that demonstrate the benefits of our method in practice. Code is available at https://github.com/ucr-optml/FedNest.

研究动机与目标

  • 为解决缺乏适用于嵌套优化问题(如超参数调优、对抗鲁棒性、演员-评论家强化学习)的联邦算法的问题。
  • 开发一种通信高效的算法,能够处理任意客户端异构性,并避免联邦双层设置中的客户端漂移。
  • 在统一的、可证明收敛的框架下,整合联邦双层、极小极大和复合优化。
  • 实现在无需显式计算 Hessian 矩阵的前提下准确估计超梯度,从而降低通信和计算开销。
  • 通过在超参数学习和极小极大优化任务上的实验,展示方法的实际优势。

提出的方法

  • FedNest 采用内层和外层变量之间的交替更新机制,对内层问题应用 FedSVRG 以减少方差,缓解客户端漂移问题。
  • 提出 FedInn,一种联邦随机方差减少算法,确保在数据异构性下本地模型的全局收敛。
  • FedOut 通过仅使用矩阵-向量乘法计算逆 Hessian-梯度乘积来计算超梯度,避免了显式 Hessian 矩阵的计算。
  • 该方法利用通信高效的矩阵-向量乘积,在少数轮次内估计全局逆 Hessian-梯度乘积。
  • LFedNest 是一种轻量级变体,其在每个外层迭代中仅在本地计算超梯度,并仅通信一次,显著提升了通信效率。
  • 该框架被推广至极小极大和复合优化问题,简化了收敛性分析并提升了性能。

实验结果

研究问题

  • RQ1在任意客户端数据异构性条件下,能否实现联邦双层优化的可证明收敛?
  • RQ2在联邦双层设置中,如何实现通信高效的超梯度计算,而无需显式求逆 Hessian 矩阵?
  • RQ3联邦嵌套优化的样本复杂度是多少?能否与非联邦最先进的方法性能相当?
  • RQ4在联邦极小极大优化中,交替 SVRG 更新与同步更新相比有何差异?
  • RQ5LFedNest 中的本地超梯度计算是否能在减少通信轮次的同时保持收敛性?

主要发现

  • FedNest 在寻找 $\epsilon$-驻点时达到 $O(\epsilon^{-2})$ 的样本复杂度,与非联邦最先进的边界一致。
  • FedInn 确保了在客户端漂移和数据异构性下,本地模型能收敛至内层问题的唯一全局最小值。
  • FedOut 通过矩阵-向量乘积计算超梯度,避免了显式 Hessian 矩阵计算,显著降低了通信成本。
  • LFedNest 仅需一次外层通信轮次即可实现优异性能,在极小极大问题中优于 FedAvg-S。
  • 实验表明,FedNest 和 LFedNest 在鞍点问题和超参数学习任务中显著优于 FedAvg-S。
  • 该方法可推广至极小极大和复合问题,收敛性保证更简化,且收敛速度优于先前的联邦方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。