[论文解读] Stochastic ADMM for Nonsmooth Optimization
本文提出了一种随机交替方向乘子法(Stochastic ADMM),用于在具有线性等式约束的非光滑凸优化问题中,处理随机目标函数。通过引入对随机分量的一阶近似并利用次梯度信息,该方法在凸函数下实现了 $O(1/ar{t})$ 的收敛速率,在强凸函数下实现了 $O(\log t / t)$ 的收敛速率,首次为目标函数值和可行性违反量建立了显式收敛速率。
We present a stochastic setting for optimization problems with nonsmooth convex separable objective functions over linear equality constraints. To solve such problems, we propose a stochastic Alternating Direction Method of Multipliers (ADMM) algorithm. Our algorithm applies to a more general class of nonsmooth convex functions that does not necessarily have a closed-form solution by minimizing the augmented function directly. We also demonstrate the rates of convergence for our algorithm under various structural assumptions of the stochastic functions: $O(1/\sqrt{t})$ for convex functions and $O(\log t/t)$ for strongly convex functions. Compared to previous literature, we establish the convergence rate of ADMM algorithm, for the first time, in terms of both the objective value and the feasibility violation.
研究动机与目标
- 解决具有线性约束的大规模分布式优化问题,目标函数为非光滑且随机的。
- 开发一种处理噪声或采样数据的 ADMM 随机变体,无需完全掌握真实数据分布。
- 为目标函数值和可行性违反量建立收敛速率,这些速率在以往文献中尚未出现。
- 为非光滑函数(如合页损失)实现闭式更新,避免每次迭代中的昂贵子问题求解。
- 将 ADMM 扩展到更广泛的凸函数类别,这些函数在增广拉格朗日框架下缺乏闭式解。
提出的方法
- 提出一种随机 ADMM 算法,通过使用随机目标函数 $\theta_1(\mathbf{x}, \bm{\xi})$ 的一阶近似,避免直接最小化增广拉格朗日函数。
- 基于 $\theta_1(\mathbf{x}_k, \bm{\xi}_{k+1})$ 的次梯度,提出 $\mathbf{x}_{k+1}$ 的改进更新规则,确保在随机采样下的收敛性。
- 采用递减步长 $\eta_{k+1}$ 和固定惩罚参数 $\beta$,以平衡收敛速度与稳定性。
- 在增广拉格朗日框架下使用对偶变量 $\bm{\lambda}$,其更新方式为 $\bm{\lambda}_{k+1} = \bm{\lambda}_k + \beta(A\mathbf{x}_{k+1} + B\mathbf{y}_{k+1} - \mathbf{b})$。
- 通过李雅普诺夫函数推导收敛界,并应用杨不等式控制随机次梯度误差。
- 提出一种新颖的分析框架,同时追踪目标误差与约束违反量,实现收敛性证明。
实验结果
研究问题
- RQ1ADMM 能否被扩展到真实目标仅能通过噪声样本访问的随机非光滑优化问题?
- RQ2在这样的随机设置下,目标函数值和可行性违反量的收敛速率可以保证多快?
- RQ3如何设计算法,使非光滑函数(如合页损失)能够实现闭式更新,避免每次迭代中的迭代子问题求解?
- RQ4在一般凸和强凸假设下,能否分别实现 $O(1/\sqrt{t})$ 和 $O(\log t / t)$ 的收敛速率?
- RQ5与在线 ADMM 和确定性 ADMM 相比,所提方法在收敛性保证和计算效率方面表现如何?
主要发现
- 所提出的随机 ADMM 在一般凸函数下实现了 $O(1/\sqrt{t})$ 的收敛速率,与确定性设置下的最优已知速率一致。
- 对于强凸函数,该方法实现了更快的 $O(\log t / t)$ 收敛速率,该速率在对数因子范围内为最优。
- 收敛性分析同时建立了目标函数值差距和可行性违反量的界,这是相较于以往仅关注变分不等式满足性的研究的新贡献。
- 该算法为非光滑合页损失函数实现了闭式更新,消除了每次迭代中对迭代 SVM 求解器的需求。
- 该方法对随机次梯度噪声具有鲁棒性,并在随机变量 $\bm{\xi}$ 的独立同分布采样下保持收敛。
- 理论分析通过李雅普诺夫函数方法得到验证,该方法可追踪迭代序列和对偶变量随时间的演化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。