[论文解读] Bias-Variance Reduced Local SGD for Less Heterogeneous Federated Learning
本文提出了一种新型的局部优化方法——偏差-方差减少的局部SGD(BVR-L-SGD),用于非凸联邦学习,通过利用局部目标函数中微小的二阶异质性,减少了梯度估计中的偏差和方差。在小异质性和大本地计算预算条件下,该方法实现了优于以往方法的通信复杂度——打破了 $\epsilon^{-1}$ 的障碍,在理论和实证上均优于非局部方法及先前的局部方法。
Recently, local SGD has got much attention and been extensively studied in the distributed learning community to overcome the communication bottleneck problem. However, the superiority of local SGD to minibatch SGD only holds in quite limited situations. In this paper, we study a new local algorithm called Bias-Variance Reduced Local SGD (BVR-L-SGD) for nonconvex distributed optimization. Algorithmically, our proposed bias and variance reduced local gradient estimator fully utilizes small second-order heterogeneity of local objectives and suggests randomly picking up one of the local models instead of taking the average of them when workers are synchronized. Theoretically, under small heterogeneity of local objectives, we show that BVR-L-SGD achieves better communication complexity than both the previous non-local and local methods under mild conditions, and particularly BVR-L-SGD is the first method that breaks the barrier of communication complexity $Θ(1/\varepsilon)$ for general nonconvex smooth objectives when the heterogeneity is small and the local computation budget is large. Numerical results are given to verify the theoretical findings and give empirical evidence of the superiority of our method.
研究动机与目标
- 通过改进局部优化方法的效率,解决联邦学习中的通信瓶颈问题。
- 克服现有局部SGD方法在高数据异质性下性能下降的理论与实证局限性。
- 开发一种方法,即使在局部目标函数表现出微小二阶异质性时,也能保持低通信复杂度。
- 在公平比较条件下(每轮通信的总本地计算量固定),从理论上和实证上证明局部方法可以优于非局部方法。
- 在温和条件下,为非凸问题建立低于 $\Theta(1/\varepsilon)$ 的通信复杂度新边界。
提出的方法
- 提出一种偏差与方差减少的局部梯度估计器,利用局部目标函数中的微小二阶异质性。
- 引入一种新颖的同步策略:不采用平均本地模型,而是随机选择一个本地模型进行全局聚合。
- 在局部目标函数具有小一阶与二阶异质性的假设下,推导理论通信复杂度边界。
- 分析一般非凸光滑目标函数的收敛性,表明当异质性较小时且本地计算量较大时,通信效率得到提升。
- 在不同异质性水平和计算预算下的图像分类任务上,实证验证了该方法的有效性。
- 采用公平比较框架,确保各方法在每轮通信中的总本地梯度计算量保持一致。
实验结果
研究问题
- RQ1在小数据异质性条件下,局部SGD变体能否在非凸联邦学习中实现优于非局部方法的通信复杂度?
- RQ2所提出的偏差与方差减少的梯度估计器是否能在局部目标函数具有微小二阶异质性时实现更优的收敛性?
- RQ3在同步时随机选择一个本地模型是否比平均策略更有效地降低通信成本?
- RQ4在温和条件下,非凸问题的局部方法通信复杂度能否低于 $\Theta(1/\varepsilon)$?
- RQ5在不同数据异质性和计算预算水平下,BVR-L-SGD与SCAFFOLD、FedAvg及非局部方法的性能相比如何?
主要发现
- 当局部目标函数异质性较小且本地计算预算较大时,BVR-L-SGD 对于非凸光滑目标函数的通信复杂度低于 $\Theta(1/\varepsilon)$,打破了以往方法的已知障碍。
- 实证结果表明,BVR-L-SGD 在所有测试的异质性水平下均持续优于 SCAFFOLD、L-SGD 和 FedAvg,且随着异质性增加,性能下降最小。
- 在固定本地计算预算 $\mathcal{B} = 1,024$ 条件下,即使在最高异质性($q = 0.5$)时,BVR-L-SGD 仍取得最佳测试准确率和最低训练损失,而其他局部方法性能显著下降。
- 随着本地计算预算 $\mathcal{B}$ 的增加,BVR-L-SGD 的性能持续提升,而非局部方法保持不变,证实了其在更大本地计算量下的优势。
- 该方法从第一轮通信起即保持优越的收敛性,所有设置下训练损失和测试准确率均持续优于所有基线方法。
- 理论分析证实,在温和条件下,BVR-L-SGD 的通信复杂度严格优于以往的非局部方法与局部方法,尤其在二阶异质性较小时表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。