Skip to main content
QUICK REVIEW

[论文解读] Adaptive Gradient Descent without Descent

Yura Malitsky, Konstantin Mishchenko|arXiv (Cornell University)|Oct 21, 2019
Sparse and Compressive Sensing Techniques参考文献 35被引用 17
一句话总结

本文提出了一种新颖的自适应梯度下降方法,仅需梯度信息即可自动根据局部曲率调整步长,无需线搜索或全局光滑性知识。该方法在全局光滑性常数为无穷时,仍能基于局部光滑性实现凸与非凸问题的收敛,且收敛速率仅依赖于局部光滑性。

ABSTRACT

We present a strikingly simple proof that two rules are sufficient to automate gradient descent: 1) don't increase the stepsize too fast and 2) don't overstep the local curvature. No need for functional values, no line search, no information about the function except for the gradients. By following these rules, you get a method adaptive to the local geometry, with convergence guarantees depending only on the smoothness in a neighborhood of a solution. Given that the problem is convex, our method converges even if the global smoothness constant is infinity. As an illustration, it can minimize arbitrary continuously twice-differentiable convex function. We examine its performance on a range of convex and nonconvex problems, including logistic regression and matrix factorization.

研究动机与目标

  • 解决梯度下降中步长选择这一长期挑战,该问题通常需要手动调参或昂贵的线搜索。
  • 开发一种方法,可自适应地适应局部几何结构,而无需依赖函数值或全局光滑性常数。
  • 在最小假设下提供收敛保证,包括全局光滑性常数为无穷的情况。
  • 仅使用梯度信息,实现对凸与非凸问题的鲁棒且自动的优化。

提出的方法

  • 该方法采用两种自适应规则:(1) 限制步长增长以防止不稳定,(2) 确保步长不会越过局部曲率。
  • 通过仅使用当前和前一时刻的梯度动态计算步长,避免线搜索或函数值评估。
  • 步长受约束:$ \lambda_k \leq \min\left\{ \sqrt{1+\theta_k}\lambda_{k-1}, \frac{\alpha \|x^k - x^{k-1}\|}{\|\nabla f_{\xi^k}(x^k) - \nabla f_{\xi^k}(x^{k-1})\|} \right\} $,其中 $ \theta_k $ 控制增长。
  • 在随机设置中,使用同一组样本计算梯度和步长,实现有偏但高效的更新。
  • 证明在强凸性和局部光滑性下,即使全局光滑性常数为无穷,方法仍可线性收敛。
  • 该方法在不依赖 $ f_* $、$ L $ 或 $ \mu $ 的情况下实现收敛,仅依赖梯度信息和局部曲率估计。

实验结果

研究问题

  • RQ1能否仅使用梯度信息实现完全自适应的梯度下降,而无需函数值评估或线搜索?
  • RQ2当全局光滑性常数为无穷时,能否在局部光滑性下保证收敛?
  • RQ3仅基于梯度差和步长增长控制的步长规则,是否能确保在凸与非凸设置下的收敛?
  • RQ4此类方法在实践中能否优于标准方法(如SGD、Adam或自适应步长)?
  • RQ5能否在不牺牲收敛性的情况下,对同一随机样本同时用于梯度和步长计算?

主要发现

  • 当全局光滑性常数为无穷时,该方法仅依赖局部光滑性即可实现凸函数的收敛。
  • 对于强凸且光滑的函数,该方法以速率 $ \mathbb{E}[\|x^k - x^*\|^2] \leq \exp(-k\alpha\mu/L) C_0 $ 线性收敛,其中 $ C_0 $ 依赖于初始误差和步长。
  • 在过参数化模型的随机设置中,该方法使用同一组样本计算梯度和步长,实现线性收敛。
  • 在图像分类任务中,该方法在ResNet-18和DenseNet-121上的性能与调优后的Adam和SGD相当或更优。
  • 为达到 $ \mathbb{E}[\|x^k - x^*\|^2] = \mathcal{O}(\varepsilon + \gamma\sigma^2) $,收敛速率为 $ \mathcal{O}(L^2/\gamma\mu^2 \log(1/\varepsilon)) $,其中 $ \gamma \leq 1 $。
  • 该方法对初始步长不佳具有鲁棒性,且无需调参 $ f_* $,与Polyak步长相比更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。