Skip to main content
QUICK REVIEW

[论文解读] A Primal-Dual SGD Algorithm for Distributed Nonconvex Optimization

Xinlei Yi, Shengjun Zhang|arXiv (Cornell University)|Jun 4, 2020
Stochastic Gradient Optimization Techniques被引用 9
一句话总结

该论文提出了一种用于在任意连接网络上进行非凸优化的分布式原始-对偶随机梯度下降(SGD)算法,利用本地信息交换和随机梯度。该算法在一般非凸函数下实现了 $\mathcal{O}(1/\sqrt{nT})$ 的线性加速收敛速率,在 Polyak–Łojasiewicz 条件下实现了 $\mathcal{O}(1/(nT))$ 的收敛速率,并在使用常数参数时线性收敛至全局最优解的邻域内。

ABSTRACT

The distributed nonconvex optimization problem of minimizing a global cost function formed by a sum of $n$ local cost functions by using local information exchange is considered. This problem is an important component of many machine learning techniques with data parallelism, such as deep learning and federated learning. We propose a distributed primal--dual stochastic gradient descent (SGD) algorithm, suitable for arbitrarily connected communication networks and any smooth (possibly nonconvex) cost functions. We show that the proposed algorithm achieves the linear speedup convergence rate $\mathcal{O}(1/\sqrt{nT})$ for general nonconvex cost functions and the linear speedup convergence rate $\mathcal{O}(1/(nT))$ when the global cost function satisfies the Polyak--Łojasiewicz (P--Ł) condition, where $T$ is the total number of iterations. We also show that the output of the proposed algorithm with constant parameters linearly converges to a neighborhood of a global optimum. We demonstrate through numerical experiments the efficiency of our algorithm in comparison with the baseline centralized SGD and recently proposed distributed SGD algorithms.

研究动机与目标

  • 解决机器学习场景中的分布式非凸优化问题,例如联邦学习和深度学习,其中数据在各参与方之间划分且通信受限。
  • 开发一种可在任意连接通信网络上运行的分布式 SGD 算法,避免星型结构主从拓扑中的通信瓶颈。
  • 为一般非凸函数和满足 Polyak–Łojasiewicz(P–Ł)条件的函数建立具有线性加速收敛保证的理论结果。
  • 消除先前分布式 SGD 方法中常见的对梯度的严格假设(如有界性)。

提出的方法

  • 该算法采用原始-对偶公式化方法,在无向通信图上协调各参与方,每个参与方维护对偶变量和原始变量的本地估计。
  • 每个参与方计算其本地代价函数的随机梯度,并通过基于一致性更新规则与邻居交换信息。
  • 该方法引入一个李雅普诺夫函数以分析收敛性,将原始误差和对偶误差项结合,以追踪向最优解的进展。
  • 采用步长调度策略并使用常数参数,实现向全局最优解邻域的线性收敛。
  • 分析中引入了 P–Ł 条件,以在更弱假设下推导出改进的收敛速率。
  • 该算法设计为通信高效,并可在任意网络拓扑中实现可扩展性。

实验结果

研究问题

  • RQ1是否可以设计一种分布式原始-对偶 SGD 算法,在无需假设梯度有界或梯度差有界的情况下,实现非凸优化的线性加速收敛?
  • RQ2当使用常数步长时,该算法是否仍能保持向全局最优解邻域的线性收敛?
  • RQ3在分布式设置下,当满足 Polyak–Łojasiewicz 条件时,收敛速率是否可提升至 $\mathcal{O}(1/(nT))$?
  • RQ4与集中式 SGD 及其他分布式 SGD 变体相比,该算法在收敛速度和鲁棒性方面表现如何?

主要发现

  • 所提出的算法在一般非凸代价函数下实现了 $\mathcal{O}(1/\sqrt{nT})$ 的线性加速收敛速率,与集中式 SGD 的最优已知速率相当。
  • 在 Polyak–Łojasiewicz(P–Ł)条件下,收敛速率提升至 $\mathcal{O}(1/(nT))$,表明在 $n$ 和 $T$ 上均实现更快的收敛。
  • 在使用常数参数时,该算法线性收敛至全局最优解的邻域,相较于标准 SGD 的次线性收敛具有显著改进。
  • 数值实验验证了该算法在收敛速度和稳定性方面优于基线集中式 SGD 及近期的分布式 SGD 方法。
  • 理论分析仅在最小假设下成立——仅需局部代价函数的光滑性,且无需对梯度有界性施加约束。
  • 该算法在包括星型图和一般无向图在内的任意通信网络拓扑中均表现出鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。