Skip to main content
QUICK REVIEW

[論文レビュー] Accelerating Rescaled Gradient Descent: Fast Optimization of Smooth Functions

Ashia Wilson, Lester Mackey|arXiv (Cornell University)|Feb 23, 2019
Sparse and Compressive Sensing Techniques参考文献 37被引用数 16
ひとこと要約

本稿では、勾配降下法と正規化勾配降下法を一般化することで、滑らかな関数における収束を加速する、新しい1次最適化アルゴリズムであるスケーリング勾配降下法(RGD)を提案する。統一されたリャプノフフレームワークを用いて、強い滑らかさ仮定のもとで、非漸近的収束速度を高速化し、加速フレームワークによりそれぞれ $ O(1/(\theta k)^p) $ および $ O(1/(\theta k)^{(3p-2)/2}) $ の収束速度を達成する。さらに、高次テンソル法や座標降下法へも拡張可能である。

ABSTRACT

We present a family of algorithms, called descent algorithms, for optimizing convex and non-convex functions. We also introduce a new first-order algorithm, called rescaled gradient descent (RGD), and show that RGD achieves a faster convergence rate than gradient descent provided the function is strongly smooth -- a natural generalization of the standard smoothness assumption on the objective function. When the objective function is convex, we present two novel frameworks for "accelerating" descent methods, one in the style of Nesterov and the other in the style of Monteiro and Svaiter, using a single Lyapunov. Rescaled gradient descent can be accelerated under the same strong smoothness assumption using both frameworks. We provide several examples of strongly smooth loss functions in machine learning and numerical experiments that verify our theoretical findings. We also present several extensions of our novel Lyapunov framework, including deriving optimal universal tensor methods and extending our framework to the coordinate setting.

研究の動機と目的

  • 強い滑らかさ仮定の下で、1次最適化アルゴリズムの分析と加速を統一するフレームワークを開発すること。
  • 勾配降下法と正規化勾配降下法の一般化として、収束速度を向上させたrescaled gradient descent (RGD) を導入すること。
  • 同じ滑らかさ条件の下で、Nesterov風およびMonteiro-Svaiter風の2つの既存フレームワークを用いて、RGDの加速を実現すること。
  • リャプノフフレームワークを拡張し、 Hölder連続な勾配をもつ関数に対する最適な普遍的高次テンソル法を導出すること。
  • フレームワークを座標降下設定に一般化し、機械学習分野における広範な応用可能性を実現すること。

提案手法

  • 勾配の双対ノルムを含む進行条件を用いて定義される、次数 $ p $ の $ \delta $-降下法の族を提案する。
  • 更新式 $ x_{k+1} = x_k - \eta^{1/(p-1)} \frac{B^{-1}\nabla f(x_k)}{\|\nabla f(x_k)\|_*^{(p-2)/(p-1)}} $ を用いて、rescaled gradient descent (RGD) を導入する。これは $ p=2 $ のとき勾配降下法、$ p=\infty $ のとき正規化勾配降下法に一般化される。
  • Nesterov風およびMonteiro-Svaiter風の両フレームワークにおける加速を統一的に分析するため、1つのリャプノフ関数を用いる。
  • 進行条件における十分な減少を保証するため、ラインサーチを適用し、最適な収束速度を達成する。
  • Hölder連続な $ (p-1) $ 階微分を持つ関数への拡張により、普遍的高次テンソル法を導出する。
  • 同じ仮定のもとで収束保証を維持しながら、フレームワークを座標降下設定に適応する。

実験結果

リサーチクエスチョン

  • RQ1強い滑らかさ仮定の下で、統一されたリャプノフフレームワークは1次最適化法の加速を可能にするか? もしそうなら、どの程度の速度で収束するか?
  • RQ2rescaled gradient descent (RGD) は滑らかな関数に対して標準的勾配降下法よりも高速に収束するか? また、既存のフレームワークを用いて加速可能か?
  • RQ3リャプノフフレームワークは、Hölder連続な勾配をもつ関数に対する最適な普遍的高次テンソル法を導出可能か?
  • RQ4加速および収束解析は座標降下設定へ一般化可能か?
  • RQ5加速された RGD の収束速度は、Runge-Kutta離散化や共形ハミルトニアン力学などの既存手法と比較してどうなるか?

主な発見

  • 強い滑らかさのもとで、凸関数に対してrescaled gradient descent (RGD) は収束速度 $ O(1/( heta k)^{p-1}) $ を達成し、標準的勾配降下法を上回る。
  • Nesterov風フレームワークを用いることで、加速された RGD は収束速度 $ O(1/( heta k)^p) $ を達成し、滑らかな凸関数における最良の既知の速度に一致する。
  • ラインサーチを用いた Monteiro-Svaiter風フレームワークにより、より高速な収束速度 $ O(1/( heta k)^{(3p-2)/2}) $ を達成する。これは与えられた滑らかさ条件下で最適である。
  • 提案されたリャプノフフレームワークにより、Hölder連続な $ (p-1) $ 階微分を持つ関数に対する最適な普遍的高次テンソル法が導出可能であり、収束速度 $ O(1/( heta k)^{(3(p-1+\nu)-2)/2}) $ を達成する。
  • フレームワークは座標降下設定へも成功裏に拡張され、収束保証が維持され、スパースかつ構造的最適化問題への応用が可能になる。
  • 数値実験により理論的収束速度が確認され、機械学習分野における強い滑らかさを持つ損失関数に対しても妥当性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。