QUICK REVIEW
[论文解读] First Analysis of Local GD on Heterogeneous Data
Ahmed Khaled, Konstantin Mishchenko|arXiv (Cornell University)|Sep 10, 2019
Stochastic Gradient Optimization Techniques参考文献 19被引用 67
一句话总结
本文提供了对本地梯度下降在设备异构数据下最小化平均的 L-平滑凸函数的收敛性分析的首个结果,表明在低精度情形下它与标准梯度下降的通信复杂性相匹配。
ABSTRACT
We provide the first convergence analysis of local gradient descent for minimizing the average of smooth and convex but otherwise arbitrary functions. Problems of this form and local gradient descent as a solution method are of importance in federated learning, where each function is based on private data stored by a user on a mobile device, and the data of different users can be arbitrarily heterogeneous. We show that in a low accuracy regime, the method has the same communication complexity as gradient descent.
研究动机与目标
- 动机与分析局部梯度下降用于平均目标 f(x)= (1/M) ∑_m f_m(x) 的情形,其中每个 f_m 都是凸且 L-光滑。
- 在联邦学习中处理设备间非独立同分布的数据,并在不做梯度有界假设的前提下理解收敛性。
- 推导邻域收敛界并将通信复杂性与精度及数据异质性联系起来。
- 突出异质性度量 sigma^2 = (1/M) ∑_m ||∇f_m(x_*)||^2 在支配收敛中的作用。
- 给出局部步数 (H) 与同步化如何影响收敛性,与集中式 GD 相比的见解。
提出的方法
- 给出在 M 个设备之间定期同步、同步之间进行局部更新的本地梯度下降算法的定义。
- 给出以 r_t = x̂_t - x_* 为变量的最优性差的递推关系,以及对 V_t(迭代方差)和 g_t(平均梯度)的界。
- 引入关键界 f( x̄_T ) - f(x_*) ≤ 2 ||x_0 - x_*||^2 /(γ T) + 24 γ^2 σ^2 H^2 L,对适当的 γ 和同步间隔 H。
- 通过在约束条件 γ ≤ 1/(4 L H) 及相关 γ 条件下最小化 T/H 来推导最优通信复杂性界。
- 通过推论 1 将本地 GD 与小批量 SGD 联系起来,在某些 H 的取值下显示 1/√(MT) 与 1/√T 的收敛速率。
实验结果
研究问题
- RQ1在不做梯度有界假设的前提下,局部梯度下降是否能够收敛以最小化异构 L-平滑凸函数的平均值?
- RQ2数据异质性(以 σ^2 表征)如何影响 Local GD 的收敛性与通信复杂性?
- RQ3局部步数 H 的数量、同步间隔与达到目标精度所需的总体通信轮数之间的关系是?
- RQ4在非独立同分布数据下,局部 GD 与标准 GD 以及小批量 SGD 在收敛速率和通信效率方面的比较如何?
主要发现
- 该方法在适当的 γ 下获得收敛界 f(x̄_T) - f(x_*) ≤ 2||x_0 - x_*||^2 /(γT) + 24 γ^2 σ^2 H^2 L。
- 当 ε 不太小(ε ≥ 3σ^2/L)时,通信复杂性与梯度下降相匹配,常数项无关紧要。
- 若 ε < 3σ^2/L,通信复杂性的渐进量级为 O(√L σ / ε^{3/2})。
- 推论在给定适当的 H 与 γ 时,通信轮数达到 1/√(MT) 的速率,显示了与小批量 SGD 间的权衡。
- 本地 GD 的行为类似于带有由 σ^2 确定的邻域大小的小批量 SGD,强调异质性对收敛的影响。
- 在 LIBSVM 数据集上的实验结果表明理论与实践相符,当在较高的通信成本下不需要非常高的精确度时,局部方法具有优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。