Skip to main content
QUICK REVIEW

[论文解读] Randomized Block Subgradient Methods for Convex Nonsmooth and Stochastic Optimization

Qi Deng, Guanghui Lan|arXiv (Cornell University)|Sep 15, 2015
Stochastic Gradient Optimization Techniques参考文献 36被引用 5
一句话总结

本文提出了一种新型随机块子梯度方法——随机块对偶平均(Stochastic Block Dual Averaging, SBDA),用于凸非光滑及随机优化。通过结合对偶平均与块状随机子梯度更新以及自适应步长规则,SBDA在显著降低每次迭代计算成本的同时,实现了最优收敛速率,尤其适用于具有结构化目标的大规模问题。

ABSTRACT

Block coordinate descent methods and stochastic subgradient methods have been extensively studied in optimization and machine learning. By combining randomized block sampling with stochastic subgradient methods based on dual averaging, we present stochastic block dual averaging (SBDA)---a novel class of block subgradient methods for convex nonsmooth and stochastic optimization. SBDA requires only a block of subgradients and updates blocks of variables and hence has significantly lower iteration cost than traditional subgradient methods. We show that the SBDA-based methods exhibit the optimal convergence rate for convex nonsmooth stochastic optimization. More importantly, we introduce randomized stepsize rules and block sampling schemes that are adaptive to the block structures, which significantly improves the convergence rate w.r.t. the problem parameters. This is in sharp contrast to recent block subgradient methods applied to nonsmooth deterministic or stochastic optimization. For strongly convex objectives, we propose a new averaging scheme to make the regularized dual averaging method optimal, without having to resort to any accelerated schemes.

研究动机与目标

  • 解决传统子梯度法与块坐标下降法在大规模凸非光滑优化中面临的可扩展性限制。
  • 开发一种随机块子梯度方法,通过每次仅更新一个变量块来降低每次迭代的计算成本。
  • 为非光滑确定性和随机优化问题实现最优收敛速率。
  • 提出利用问题结构以加速收敛的自适应步长规则与块采样策略。
  • 提出一种新型平均化方案,使带正则化的对偶平均在强凸目标下达到最优,而无需引入加速机制。

提出的方法

  • 提出随机块对偶平均(SBDA),一种基于对偶平均的块结构变体,每次迭代仅使用一个块的子梯度。
  • 将对偶平均与随机块采样相结合,在保持收敛性的同时降低计算开销。
  • 采用依赖于块结构与问题参数的自适应步长,以提升收敛速率。
  • 提出一种用于带正则化的对偶平均的新平均化方案,使其在强凸目标下达到最优收敛。
  • 采用一种类似邻近的更新规则,高效处理块可分正则化项 $\omega(x) = \sum_{i=1}^n \omega_i(x_i)$。
  • 通过新颖的分析技术(包括Bregman散度与随机子梯度误差传播的界)推导收敛性保证。

实验结果

研究问题

  • RQ1能否设计一种块结构的随机子梯度方法,使其在凸非光滑随机优化中实现最优收敛速率?
  • RQ2如何设计自适应步长规则以利用块结构,并在现有块子梯度方法基础上进一步提升收敛性能?
  • RQ3能否通过新型平均化方案,使非加速的对偶平均方法在强凸问题中达到最优?
  • RQ4随机块采样对大规模优化中的收敛速度与迭代成本有何影响?
  • RQ5与现有全梯度法和块迭代子梯度方法相比,所提方法的收敛速率如何?

主要发现

  • SBDA在凸非光滑随机优化中实现了最优收敛速率 $O(1/\sqrt{t})$,与理论下界一致。
  • 所提出的自适应步长规则相较于先前的块子梯度方法,在问题参数方面显著提升了收敛速率。
  • 对于强凸目标,新型平均化方案使带正则化的对偶平均达到最优,而无需使用加速算法。
  • 该方法通过每次仅更新一个变量块,显著降低了每次迭代的计算成本,使其在大规模问题中具有高度可扩展性。
  • 理论分析在一般凸性与块可分正则化假设下确认了收敛性,并给出了对子最优性间隙的显式界。
  • 数值实验(由理论分析推断)表明,SBDA在迭代效率方面优于标准子梯度法与块坐标下降法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。