Skip to main content
QUICK REVIEW

[论文解读] The Min-Max Complexity of Distributed Stochastic Convex Optimization with Intermittent Communication

Blake Woodworth, Brian Bullins|arXiv (Cornell University)|Feb 2, 2021
Stochastic Gradient Optimization Techniques参考文献 49被引用 11
一句话总结

本文解决了间歇通信下分布式随机凸优化的极小极大复杂度,证明了在对数因子范围内,使用所有机器每轮的最小批量加速SGD(Minibatch Accelerated SGD)或仅使用一台机器的单机加速SGD(Single-Machine Accelerated SGD)是最优的。关键结果表明,对于光滑凸目标函数,利用并行性和本地计算的更复杂方法无法改善收敛速率。

ABSTRACT

We resolve the min-max complexity of distributed stochastic convex optimization (up to a log factor) in the intermittent communication setting, where $M$ machines work in parallel over the course of $R$ rounds of communication to optimize the objective, and during each round of communication, each machine may sequentially compute $K$ stochastic gradient estimates. We present a novel lower bound with a matching upper bound that establishes an optimal algorithm.

研究动机与目标

  • 确定在间歇通信模型下分布式随机凸优化的基本极小极大复杂度,其中M台机器仅通信R次。
  • 弥合对通信频率(R)与每轮本地计算量(K)如何影响收敛速率的理解差距,因为先前的下界仅依赖于乘积KR。
  • 确定更复杂的算法——超越简单的最小批量或单机方法——是否能实现更好的收敛速率。
  • 提供一个紧致的下界,与上界匹配,从而在对数因子范围内识别出最优的算法配置。
  • 分析自洽性(self-concordance)和准自洽性(quasi-self-concordance)在塑造复杂度中的作用,特别是与高阶光滑性之间的关系。

提出的方法

  • 基于构造一个具有受控曲率和梯度噪声的自洽或准自洽目标函数,提出一种新颖的下界技术。
  • 采用零尊重预言机模型来形式化分布式间歇通信的约束,其中每台机器每轮计算K个随机梯度,且所有机器每R轮同步通信一次。
  • 以AC-SA(加速随机逼近)方法作为基础算法原语,分析两种方法:每轮使用全部M台机器的最小批量AC-SA(Minibatch AC-SA),以及仅使用一台机器进行KR步的单机AC-SA(Single-Machine AC-SA)。
  • 推导出一个依赖于H(光滑性)、B(初始到最优值的距离)、σ(梯度噪声)、K(每轮梯度数)、R(通信轮数)和M(机器数量)的次优性下界,分别针对Q-自洽和Q-准自洽目标函数。
  • 通过在H' ≤ H的光滑性参数上优化下界以收紧结果,表明最坏情况下的收敛速率由涉及KR、R、M和K的若干项的最小值决定。
  • 通过证明更好的两种简单方法(最小批量或单机AC-SA)能达到下界,从而展示匹配的上界,仅相差对数因子。

实验结果

研究问题

  • RQ1在分布式随机凸优化中,最优收敛速率是否分别依赖于通信轮数R和每轮梯度数K,还是仅依赖于其乘积KR?
  • RQ2在间歇通信模型中,能否设计出比最小批量或单机SGD更优的复杂算法,以同时利用并行性和本地计算?
  • RQ3在间歇通信设置下,光滑凸随机优化的基本极小极大复杂度是多少,以对数因子为界?
  • RQ4目标函数的自洽性和准自洽性特性如何影响分布式设置下的收敛速率?
  • RQ5单轮通信(R=1)是否足以使一般光滑凸目标函数达到最优收敛速率?

主要发现

  • 间歇通信下分布式随机凸优化的极小极大复杂度被紧密刻画,其下界与最优可实现速率在对数因子范围内匹配。
  • 下界表明,最优速率由三项的最小值决定:$\frac{HB^2}{K^2R^2}$,$\min\left\{\frac{\sigma B}{\sqrt{MKR}}, HB^2\right\}$,以及$\min\left\{\frac{HB^2}{R^2\log^2 M}, \frac{Q^4\sigma^4 B^2}{H^7 K^2 R^2}, \frac{\sigma B}{\sqrt{KR}}\right\}$,具体取决于问题参数。
  • 对于Q-自洽目标函数,最优速率是$\Omega\left(\frac{HB^2}{K^2R^2} + \min\left\{\frac{\sigma B}{\sqrt{MKR}}, HB^2\right\} + \min\left\{\frac{HB^2}{R^2\log^2 M}, \frac{Q^2\sigma^2 B^2}{K R^2 \log M}, \frac{\sigma B}{\sqrt{KR}}\right\}\right)$。
  • 对于Q-准自洽目标函数,最优速率是$\Omega\left(\frac{HB^2}{K^2R^2} + \min\left\{\frac{\sigma B}{\sqrt{MKR}}, HB^2\right\} + \min\left\{\frac{HB^2}{R^2\log^2 M}, \frac{Q\sigma B^2}{\sqrt{K} R^2 \log^{3/2} M}, \frac{\sigma B}{\sqrt{KR}}\right\}\right)$。
  • 分析证明,最小批量加速SGD和单机加速SGD在收敛速率上均无法被超越,因为两者中更好的一种在对数因子范围内已达到最优。
  • 该结果意味着,对于一般光滑凸目标函数,利用并行性和本地计算的更复杂算法无法在最坏情况保证下优于这两种简单策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。