Skip to main content
QUICK REVIEW

[论文解读] Revisiting the Polyak step size

Elad Hazan, Sham M. Kakade|arXiv (Cornell University)|May 1, 2019
Stochastic Gradient Optimization Techniques参考文献 5被引用 10
一句话总结

本文重新审视了梯度下降中的Polyak步长,证明一种简化变体在所有标准凸优化场景下——非光滑、光滑、强凸及条件良好——均能实现近似最优的收敛速率,且无需预先知晓光滑性、强凸性或Lipschitz参数。该方法通过次优性差距与梯度范数自适应调整步长,以参数无关的方式实现最优收敛速率。

ABSTRACT

This paper revisits the Polyak step size schedule for convex optimization problems, proving that a simple variant of it simultaneously attains near optimal convergence rates for the gradient descent algorithm, for all ranges of strong convexity, smoothness, and Lipschitz parameters, without a-priory knowledge of these parameters.

研究动机与目标

  • 解决一阶凸优化中缺乏参数无关、自适应步长调度的问题,该调度需在不同问题场景下同时实现最优收敛速率。
  • 探究是否存在单一的步长规则,可在不预先知晓光滑性、强凸性或Lipschitz参数的情况下,自适应地适应不同平滑度、强凸性和Lipschitz参数水平。
  • 证明Polyak步长——此前仅被认为在非光滑凸问题中为最优——可扩展至所有标准凸优化场景,实现最优收敛速率。
  • 设计一种自适应算法,动态优化最优值的下界,并利用该下界计算步长,确保无需调参即可收敛。
  • 提供理论保证,证明所提方法在所有凸优化场景下均能达到已知最优收敛速率,包括条件良好问题的指数收敛速率。

提出的方法

  • 提出Polyak步长的一种变体:$\eta_t = \frac{f(\mathbf{x}_t) - f(\mathbf{x}^\star)}{\|\nabla_t\|^2}$,利用次优性差距与梯度范数自适应设定步长。
  • 提出一种自适应算法(算法3),维护$ f(\mathbf{x}^\star) $的下界$\tilde{f}$,并在当前迭代未达到所需精度时通过二分法更新该下界。
  • 以不等式 $d_{t+1}^2 \leq d_t^2 - 2\eta_t h_t + \eta_t^2 \|\nabla_t\|^2$(引理1)作为核心递推关系,用于基于到最优解距离的收敛性分析。
  • 通过比较$ d_t^2 $的减少量与次优性差距$ h_t $,建立收敛边界,利用强凸性与光滑性性质,将$ h_t $与$ \|\nabla_t\|^2 $关联。
  • 对下界$\tilde{f}$实施递归细化,每次迭代要么返回次优性$\leq R_{T,1/2}$的点,要么将与真实最优值的差距减半。
  • 证明该算法在不同问题场景下,可实现四种已知最优速率的最小值:$O(1/\sqrt{T})$、$O(\beta/T)$、$O(1/(\alpha T))$ 与 $O(e^{-\beta/\alpha \cdot T})$。

实验结果

研究问题

  • RQ1是否存在一种单一的、参数无关的步长调度,可在所有标准凸优化场景——非光滑、光滑、强凸与条件良好——中实现最优收敛速率,且无需预先知晓参数?
  • RQ2Polyak步长最初仅针对非光滑凸问题提出,其是否可推广至光滑与强凸场景,以实现最优收敛速率?
  • RQ3能否设计一种自适应算法,动态估计最优值并据此计算步长,实现无需调参的最优收敛速率?
  • RQ4在缺乏光滑性、强凸性或Lipschitz常数知识的条件下,使用Polyak步长的梯度下降收敛性可提供哪些理论保证?
  • RQ5算法3中的自适应下界细化策略如何确保在每种问题场景下以已知最优速率收敛至最优解?

主要发现

  • 所提出的Polyak步长变体在所有标准凸优化场景——非光滑、光滑、强凸与条件良好——中均实现了已知最优收敛速率,且无需预先知晓$\alpha$、$\beta$或$G$。
  • 对于非光滑凸问题,该方法实现$O(1/\sqrt{T})$的收敛速率,与投影梯度下降的最优速率一致。
  • 对于$\beta$-光滑问题,该方法实现$O(\beta/T)$的收敛速率,与已知最优速率一致。
  • 对于$\alpha$-强凸问题,该方法实现$O(1/(\alpha T))$的收敛速率,这是梯度下降的最优速率。
  • 对于$\alpha$-强凸且$\beta$-光滑的问题,该方法实现指数级$O(e^{-\beta/\alpha \cdot T})$的收敛速率,与目前已知最优速率一致。
  • 自适应算法(算法3)确保在$K = \lceil 2\log(f(\mathbf{x}^\star) - \tilde{f}_0)/B_T \rceil$轮迭代后,最终迭代点满足$f(\bar{\mathbf{x}}) - f(\mathbf{x}^\star) \leq f(\mathbf{x}^\star) + B_T$,其中$B_T$为四种最优速率的最小值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。