Skip to main content
QUICK REVIEW

[论文解读] Variance-Reduced Decentralized Stochastic Optimization with Gradient Tracking--Part I: GT-SAGA

Ran Xin, Usman A. Khan|arXiv (Cornell University)|Sep 25, 2019
Stochastic Gradient Optimization Techniques参考文献 61被引用 9
一句话总结

本文提出 GT-SAGA,一种方差缩减的去中心化随机优化算法,结合梯度追踪与 SAGA 方差缩减技术,实现了对平滑且强凸的有限和问题的线性收敛。其局部梯度计算复杂度达到最优的 $\mathcal{O}\left(\max\left\{M,\frac{M}{m}\frac{Q^{2}}{(1-\sigma)^{2}}\right\}\log\frac{1}{\epsilon}\right)$,在大规模设置下优于现有去中心化方案。

ABSTRACT

In this paper, we study decentralized empirical risk minimization problems, where the goal is to minimize a finite-sum of smooth and strongly-convex functions available over a network of nodes. In this Part I, we propose extbf{ exttt{GT-SAGA}}, a decentralized stochastic first-order algorithm based on gradient tracking \cite{DSGT_Pu,DSGT_Xin} and a variance-reduction technique called SAGA \cite{SAGA}. We develop the convergence analysis and the iteration complexity of this algorithm. We further demonstrate various trade-offs and discuss scenarios in which extbf{ exttt{GT-SAGA}} achieves superior performance (in terms of the number of local gradient computations required) with respect to existing decentralized schemes. In Part II \cite{GT_SVRG} of this two-part paper, we develop and analyze extbf{ exttt{GT-SVRG}}, a decentralized gradient tracking based implementation of SVRG \cite{SVRG}, another well-known variance-reduction technique.

研究动机与目标

  • 为解决在大规模、分布式数据下的去中心化经验风险最小化中实现快速收敛的挑战。
  • 在去中心化设置中结合梯度追踪与 SAGA 方差缩减的优点,以加速收敛。
  • 推导出对条件数 $Q = L/\mu$、网络连通性 $\sigma$ 和本地数据大小 $m$ 有利依赖的收敛速率。
  • 证明 GT-SAGA 相较于现有去中心化一阶方法具有更优的迭代复杂度。

提出的方法

  • GT-SAGA 将 SAGA 方差缩减机制与去中心化梯度追踪相结合,以在各节点间保持精确的梯度估计。
  • 每个节点维护一个全局梯度的本地估计,并通过本地梯度与邻居信息的组合进行更新。
  • 算法使用一个双随机权重矩阵 $W$,其次大奇异值为 $\sigma$,以建模网络通信。
  • 采用依赖于 $m$、$M$、$Q$、$L$、$\mu$ 和 $\sigma$ 的步长 $\alpha$,在强凸性和光滑性假设下确保线性收敛。
  • 收敛性分析基于李雅普诺夫函数对误差项进行有界,并推导出控制线性速率的压缩因子 $1/\kappa$。
  • 证明当步长 $\alpha$ 选择在阈值 $\overline{\alpha}$ 以下时,该方法可实现线性收敛,其中 $\overline{\alpha}$ 依赖于 $m/M$、$Q$、$L$、$\mu$ 和 $\sigma$。

实验结果

研究问题

  • RQ1能否将集中式优化中的方差缩减技术有效适配到去中心化随机设置中以改善收敛性?
  • RQ2本地数据大小 $m$、全局条件数 $Q$ 和网络连通性 $\sigma$ 之间的相互作用如何影响去中心化算法的收敛速率?
  • RQ3去中心化随机优化中,本地计算与通信之间的最优权衡是什么?
  • RQ4将梯度追踪与 SAGA 结合是否能实现比现有去中心化方法更优的可证明收敛速率?
  • RQ5步长 $\alpha$ 需满足何种条件才能确保所提算法的线性收敛?

主要发现

  • GT-SAGA 实现 $\mathcal{O}\left(\max\left\{M,\frac{M}{m}\frac{Q^{2}}{(1-\sigma)^{2}}\right\}\log\frac{1}{\epsilon}\right)$ 次局部梯度计算即可达到 $\epsilon$-精度,这在大规模场景下为最优复杂度。
  • 当本地数据大小 $m$ 较大时,算法的收敛速率显著提升,在此类设置下优于 DSA 和 Diffusion-AVRG 等方法。
  • 为确保线性收敛,步长 $\alpha$ 必须小于 $\overline{\alpha} = \min\left\{\frac{(1-\sigma^{2})^{2}}{30\sqrt{10}}\frac{\sqrt{m}}{\sqrt{M}LQ}, \frac{m}{96M}\frac{1}{QL}, \frac{1-\sigma^{2}}{60\sqrt{5}L}\right\}$。
  • 当 $\alpha = \frac{m}{M}\frac{(1-\sigma^{2})^{2}}{150QL}$ 时,压缩因子满足 $\frac{1}{\kappa} \leq \min\left\{\frac{3(1-\sigma^{2})}{10}, \frac{3}{1000}\frac{m}{M}\frac{(1-\sigma^{2})^{2}}{Q^{2}}, \frac{1}{6M}, \frac{1-\sigma^{2}}{2250}\right\}$,从而证明了线性收敛。
  • GT-SAGA 的收敛速率随网络连通性 $\sigma$ 的提升而显著改善,且当 $\sigma \to 1$ 时性能更优;同时,更大的 $m$ 可降低对有效条件数的依赖。
  • 在 $m$ 较大时,GT-SAGA 在 $m$、$M$、$Q$ 和 $\sigma$ 的联合依赖关系上优于当前最先进方法(如 DSA、Diffusion-AVRG 和 ADFS)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。