Skip to main content
QUICK REVIEW

[论文解读] Dual-Free Stochastic Decentralized Optimization with Variance Reduction

Hadrien Hendrikx, Francis Bach|arXiv (Cornell University)|Jun 25, 2020
Stochastic Gradient Optimization Techniques参考文献 38被引用 6
一句话总结

该论文提出DVR(双对偶自由随机去中心化优化算法),通过仅使用本地随机梯度实现方差缩减,其计算效率与单机随机方差缩减方法在处理1/n数据量时相当。该方法利用特定Bregman散度上的对偶问题的Bregman坐标下降,消除了对对偶变量的计算需求,从而在不依赖昂贵的近端或共轭梯度预言机的情况下实现更快收敛。

ABSTRACT

We consider the problem of training machine learning models on distributed data in a decentralized way. For finite-sum problems, fast single-machine algorithms for large datasets rely on stochastic updates combined with variance reduction. Yet, existing decentralized stochastic algorithms either do not obtain the full speedup allowed by stochastic updates, or require oracles that are more expensive than regular gradients. In this work, we introduce a Decentralized stochastic algorithm with Variance Reduction called DVR. DVR only requires computing stochastic gradients of the local functions, and is computationally as fast as a standard stochastic variance-reduced algorithms run on a $1/n$ fraction of the dataset, where $n$ is the number of nodes. To derive DVR, we use Bregman coordinate descent on a well-chosen dual problem, and obtain a dual-free algorithm using a specific Bregman divergence. We give an accelerated version of DVR based on the Catalyst framework, and illustrate its effectiveness with simulations on real data.

研究动机与目标

  • 解决去中心化随机优化中的空白:现有方法或缺乏线性收敛性,或需要昂贵的对偶预言机。
  • 设计一种去中心化算法,其计算速度与单机随机方差缩减方法相当,且不依赖对偶变量或复杂子程序。
  • 通过利用Bregman散度与去中心化环境中的方差缩减,实现计算与通信的最优收敛速率。
  • 为现有需要近端算子或Fenchel共轭梯度的去中心化随机算法提供一种实用且高效的替代方案。

提出的方法

  • 提出DVR(去中心化方差缩减)算法,通过在精心选择的对偶问题上使用Bregman坐标下降,推导出一种双对偶自由方法。
  • 采用特定Bregman散度,消除对计算对偶变量或共轭梯度的需求,简化实现。
  • 仅使用局部函数的随机梯度,避免使用近端算子或Fenchel共轭等计算昂贵的预言机。
  • 通过Catalyst框架引入加速变体,提升收敛速率,同时保持计算效率。
  • 通过利用gossip矩阵的谱性质与条件数,对虚拟误差与参数偏差进行有界分析,推导收敛保证。
  • 在外层迭代中采用热启动策略,利用前一迭代的近似解,加速内层虚拟下降步的收敛。

实验结果

研究问题

  • RQ1能否设计一种去中心化随机优化算法,实现与单机随机方差缩减方法相当的计算效率,且不依赖对偶变量或昂贵预言机?
  • RQ2是否可能设计一种双对偶自由的去中心化算法,仅通过本地随机梯度计算即可保持线性收敛?
  • RQ3在对偶问题上使用Bregman坐标下降,如何在去中心化环境中实现计算高效且无对偶变量的算法?
  • RQ4通信成本与网络结构(通过谱隙γ表示)对去中心化方差缩减算法收敛性有何影响?
  • RQ5能否在去中心化随机优化中有效应用Catalyst框架的加速机制,同时保持计算效率?

主要发现

  • DVR的计算复杂度等价于在总数据集的1/n上运行标准随机方差缩减算法,显著降低每个节点的计算负担。
  • 该算法仅需本地随机梯度评估,无需近端算子或Fenchel共轭梯度,后者通常计算代价高昂。
  • 基于Catalyst框架的加速版DVR在对数因子范围内达到最优收敛率O(√κb(1 + τ/√γ) log(ε⁻¹))。
  • 在RCV1数据集上的模拟结果表明,当通信成本τ适中时,加速版DVR在整体运行时间上优于标准和加速版EXTRA。
  • 该方法在随机条件数κs与网络谱隙γ的依赖下保持线性收敛,表明其在不同图拓扑结构下均具鲁棒性。
  • 理论分析证实,内层循环的虚拟误差以速率(1−ρ)^K几何级递减,当K适切选择时可确保快速收敛。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。