Skip to main content
QUICK REVIEW

[论文解读] Primal-dual stochastic gradient method for convex programs with many functional constraints

Yangyang Xu|arXiv (Cornell University)|Feb 8, 2018
Stochastic Gradient Optimization Techniques参考文献 34被引用 16
一句话总结

本文提出了一种针对具有大量函数约束的凸优化问题的新型原始-对偶随机梯度方法,每轮迭代仅评估一个随机采样的约束。通过结合增广拉格朗日函数与随机对偶更新的自适应随机次梯度更新,该方法在凸问题上实现了最优的 $O(1/\sqrt{k})$ 收敛速率,在强凸问题上实现了近乎最优的 $O((\log k)/k)$ 收敛速率,且每轮迭代的计算复杂度较低。

ABSTRACT

Stochastic gradient method (SGM) has been popularly applied to solve optimization problems with objective that is stochastic or an average of many functions. Most existing works on SGMs assume that the underlying problem is unconstrained or has an easy-to-project constraint set. In this paper, we consider problems that have a stochastic objective and also many functional constraints. For such problems, it could be extremely expensive to project a point to the feasible set, or even compute subgradient and/or function value of all constraint functions. To find solutions of these problems, we propose a novel (adaptive) SGM based on the classical augmented Lagrangian function. Within every iteration, it inquires a stochastic subgradient of the objective, and a subgradient and the function value of one randomly sampled constraint function. Hence, the per-iteration complexity is low. We establish its convergence rate for convex problems and also problems with strongly convex objective. It can achieve the optimal $O(1/\sqrt{k})$ convergence rate for convex case and nearly optimal $O\big((\log k)/k\big)$ rate for strongly convex case. Numerical experiments on a sample approximation problem of the robust portfolio selection and quadratically constrained quadratic programming are conducted to demonstrate its efficiency.

研究动机与目标

  • 解决具有大量函数约束的凸随机规划问题的挑战,其中完整投影或次梯度评估在计算上不可行。
  • 设计一种即使在约束数量极高的情况下也能保持低每轮迭代复杂度的随机一阶方法。
  • 在仅能访问随机次梯度和函数值的前提下,为凸问题和强凸问题实现最优或近似最优的收敛速率。
  • 为原始变量设计一种自适应步长策略,使其与累积次梯度范数成比例,以改善收敛性能。
  • 在最小假设条件下确保收敛,包括仅能访问目标函数的随机次梯度和采样约束函数的次梯度。

提出的方法

  • 基于增广拉格朗日函数提出一种原始-对偶随机梯度方法,将目标函数与约束项合并为一个单一的鞍点问题。
  • 在每轮迭代中,以均匀随机方式采样一个约束函数,并仅查询其次梯度和函数值,从而降低每轮迭代的计算成本。
  • 利用采样约束的次梯度和函数值构造增广拉格朗日函数的随机次梯度,从而通过投影次梯度下降实现原始变量的更新。
  • 在原始变量更新中使用对角预条件矩阵 $\mathbf{D}_k$,并设置两种情形:固定步长和基于累积次梯度范数的自适应步长。
  • 通过仅修改对应于采样约束的分量的随机坐标更新规则来更新对偶变量 $\mathbf{z}$。
  • 在 $\mathbf{D}_k$ 中引入一种自适应步长策略,将过去随机次梯度的 $\ell_2$-范数纳入考虑,从而在病态条件设置下提升收敛性能。

实验结果

研究问题

  • RQ1能否设计一种随机原始-对偶方法,以处理具有大量函数约束的凸规划问题,同时保持低每轮迭代复杂度?
  • RQ2当每轮仅采样一个约束,且目标函数与约束的次梯度为随机时,可实现何种收敛速率?
  • RQ3在该采样与随机性设定下,该方法能否实现凸问题的最优 $O(1/\sqrt{k})$ 收敛速率,以及强凸问题的近乎最优 $O((\log k)/k)$ 收敛速率?
  • RQ4基于累积次梯度范数的自适应步长选择在理论与实际中如何影响收敛性能?
  • RQ5所提出的方法在大规模问题(如鲁棒投资组合选择和二次约束二次规划)中是否具有数值效率与可扩展性?

主要发现

  • 所提方法在凸问题上实现了最优的 $O(1/\sqrt{k})$ 收敛速率,与已知最优随机次梯度方法的收敛速率一致。
  • 在强凸问题中,该方法达到了近乎最优的 $O((\log k)/k)$ 收敛速率,仅相差一个对数因子,因此是紧致的。
  • 收敛性保证在标准假设下成立,包括随机次梯度方差有界以及约束函数次梯度有界。
  • $\mathbf{D}_k$ 中的自适应步长策略相比固定步长显著提升了数值稳定性和收敛速度。
  • 在鲁棒投资组合选择和二次约束二次规划上的数值实验验证了该方法在约束数量增加时的高效性与可扩展性。
  • 该方法的每轮迭代成本保持较低水平,因为每轮仅需一个采样约束的次梯度和函数值,因此适用于大规模问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。