[论文解读] Distributed stochastic optimization with gradient tracking over strongly-connected networks
该论文提出S-AB,一种用于强连通有向网络的分布式随机优化算法,其中各 agent 通过使用随机一阶预言机来最小化局部平滑且强凸的代价函数之和。通过同时采用行随机和列随机权重矩阵来追踪全局梯度并实现一致性,S-AB在足够小的常数步长下,以期望形式实现线性收敛至全局最小值的邻域,且无需使用双重随机权重或特征向量估计。
In this paper, we study distributed stochastic optimization to minimize a sum of smooth and strongly-convex local cost functions over a network of agents, communicating over a strongly-connected graph. Assuming that each agent has access to a stochastic first-order oracle ($\mathcal{SFO}$), we propose a novel distributed method, called $\mathcal{S}$-$\mathcal{AB}$, where each agent uses an auxiliary variable to asymptotically track the gradient of the global cost in expectation. The $\mathcal{S}$-$\mathcal{AB}$ algorithm employs row- and column-stochastic weights simultaneously to ensure both consensus and optimality. Since doubly-stochastic weights are not used, $\mathcal{S}$-$\mathcal{AB}$ is applicable to arbitrary strongly-connected graphs. We show that under a sufficiently small constant step-size, $\mathcal{S}$-$\mathcal{AB}$ converges linearly (in expected mean-square sense) to a neighborhood of the global minimizer. We present numerical simulations based on real-world data sets to illustrate the theoretical results.
研究动机与目标
- 开发一种适用于任意强连通有向图的分布式随机优化方法,避免对双重随机权重的需求。
- 在局部代价函数为平滑且强凸,且各 agent 仅能访问随机一阶预言机的前提下,实现向全局最小值邻域的线性收敛。
- 消除先前在有向图上梯度追踪方法中需要单独进行特征向量估计的步骤,从而避免其对收敛速度的负面影响。
- 通过利用权重矩阵的左、右特征向量,对非2-范数下的收缩性进行刻画,从而提供精确且明确的收敛边界。
- 在逻辑回归设置下,利用来自MNIST数据集的真实世界数据验证理论结果。
提出的方法
- S-AB采用两阶段更新:各 agent 使用行随机权重矩阵对其自身及邻居的解估计值执行加权平均。
- 同时,各 agent 维护并使用列随机权重矩阵更新一个辅助梯度追踪变量,以在期望下估计全局梯度。
- 每个 agent 将其局部随机梯度估计值与邻居梯度估计值的加权平均相结合,以更新其全局梯度追踪器。
- 该算法避免使用双重随机权重,因此可适用于任意强连通有向图。
- 收敛性分析基于构造李雅普诺夫函数,并利用行随机与列随机矩阵的谱性质推导出对步长的条件。
- 基于权重矩阵的谱半径和特征向量,推导出明确的步长上界,确保在期望均方意义下的线性收敛。
实验结果
研究问题
- RQ1能否设计一种分布式随机优化算法,在无需使用双重随机权重的前提下,实现在任意强连通有向图上的线性收敛?
- RQ2如何在有向网络中有效结合梯度追踪与随机一阶预言机,以同时保证一致性与最优性?
- RQ3哪些关于步长和网络拓扑的显式条件可保证向全局最小值邻域的线性收敛?
- RQ4是否可通过避免依赖2-范数收缩,改用基于行随机与列随机矩阵的左、右特征向量所导出的范数,使收敛分析更加精确且明确?
- RQ5在真实世界数据上,所提出的S-AB算法与非随机AB方法及集中式随机梯度下降基线相比,实际表现如何?
主要发现
- 在足够小的常数步长下,S-AB以期望均方意义实现向全局最小值邻域的线性收敛,即使不使用双重随机权重亦成立。
- 步长上界被明确推导为 α < (1−σ²_A)(πᵀ_r π_c) / (lκ∥π_r∥₂∥π_c∥₂) × √( (1−σ²_B) / (384hrhc(64 + n∥π_c∥²₂)) ),其基于权重矩阵的谱性质。
- 只要图是强连通的且权重矩阵是本原的,即使网络为有向且通信不对称,该算法仍能实现线性收敛。
- 在MNIST数据上的数值实验表明,S-AB优于非随机AB方法,并在测试准确率和残差衰减方面接近集中式随机梯度下降(C-SGD)的性能。
- 当步长减小且梯度噪声方差降低时,收敛结果中的误差界趋于消失,证实了对噪声和步长选择的鲁棒性。
- 该分析避免依赖2-范数收缩,通过利用行随机与列随机矩阵的左、右特征向量所导出的范数,提供了更精确的收敛边界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。