Skip to main content
QUICK REVIEW

[論文レビュー] On the Lower Bound of Minimizing Polyak-Łojasiewicz Functions

Pengyun Yue, Cong Fang|arXiv (Cornell University)|Dec 27, 2022
Stochastic Gradient Optimization Techniques被引用数 5
ひとこと要約

この論文は、$L$-スムーズでポリャク=ロジャスエヴィッチ(PL)定数 $\mu$ を持つ関数を最小化する任意の1次オラクルに対して、$\varepsilon$-近似最小値を求めるために必要な勾配評価回数のタイトな下界 $\Omega\left(\frac{L}{\mu}\log\frac{1}{\varepsilon}\right)$ を確立している。この結果により、勾配降下法が滑らかなPL関数を最小化する上で本質的に最適であることが示され、一般に、より速い収束率を保証する1次法は存在しない。これは、勾配降下法が最適であることを示し、モーメンタムに基づく加速が可能である強い凸関数とは異なり、PL関数の複雑さが本質的に異なることを示している。

ABSTRACT

Polyak-Łojasiewicz (PL) [Polyak, 1963] condition is a weaker condition than the strong convexity but suffices to ensure a global convergence for the Gradient Descent algorithm. In this paper, we study the lower bound of algorithms using first-order oracles to find an approximate optimal solution. We show that any first-order algorithm requires at least $Ω\left(\frac{L}μ\log\frac{1}{\varepsilon} ight)$ gradient costs to find an $\varepsilon$-approximate optimal solution for a general $L$-smooth function that has an $μ$-PL constant. This result demonstrates the optimality of the Gradient Descent algorithm to minimize smooth PL functions in the sense that there exists a ``hard'' PL function such that no first-order algorithm can be faster than Gradient Descent when ignoring a numerical constant. In contrast, it is well-known that the momentum technique, e.g. [Nesterov, 2003, chap. 2] can provably accelerate Gradient Descent to ${O}\left(\sqrt{\frac{L}{\hatμ}}\log\frac{1}{\varepsilon} ight)$ gradient costs for functions that are $L$-smooth and $\hatμ$-strongly convex. Therefore, our result distinguishes the hardness of minimizing a smooth PL function and a smooth strongly convex function as the complexity of the former cannot be improved by any polynomial order in general.

研究の動機と目的

  • パrameter $\mu$ を持つ $L$-スムーズでポリャク=ロジャスエヴィッチ(PL)条件を満たす関数を最小化するための、より速い1次アルゴリズムが存在するかを特定すること。
  • PL関数に対して、標準的な勾配降下法の収束速度を上回る可能性があるモーメンタムやその他の加速技術の有効性について、理解のギャップを埋めること。
  • 滑らかなPL関数を最小化する際に、$\varepsilon$-精度を達成するために必要な勾配評価回数の次元に依存しないミニマックス下界を確立すること。
  • 滑らかなPL関数を最小化する問題のアルゴリズム的難易度と、滑らかな強い凸関数を最小化する問題の難易度を、1次オラクルの複雑さという観点から明確に区別すること。

提案手法

  • 1つの座標を1回ずつ解消する必要が生じるような、巧みに設計された「ゼロチェーン」関数を構築し、変数間で逐次的依存関係を模倣する。
  • ヘッセ行列における再帰的構造を用いて、ある変数の勾配情報が他の変数に与える影響を最小限に抑え、各座標ごとの最適化プロセスを分離する。
  • 補助変数 $\tilde{\mathbf{z}}_k$ を定義し、それらを用いて関数の曲率とPL条件に基づいて勾配ノルムの下界を導出する。
  • 各反復回数 $t$ における各座標が最適値から十分に離れているかどうかを追跡するための支配条件 $\mathsf{Dominate}(k)$ を定義する。
  • ある座標 $k$ が支配されていない場合、$\mathbf{x}_k$ における勾配ノルムが正の定数で下から抑えられることを示し、関数値の差が $\varepsilon$ 未満に減少できないことを示す。
  • $T$ 回の反復後に、関数値の差を $\varepsilon$ 未満に抑えるために、少なくとも $\Omega\left(\frac{L}{\mu}\log\frac{1}{\varepsilon}\right)$ 回の勾配評価が必要であることを示し、下界を導出する。

実験結果

リサーチクエスチョン

  • RQ1滑らかなPL関数を最小化する任意の1次アルゴリズムが、$O\left(\frac{L}{\mu}\log\frac{1}{\varepsilon}\right)$ より速い収束速度を達成できるか。
  • RQ2標準的な勾配降下法は、滑らかなPL関数を最小化する上で最適であるのか、それともモーメンタムなどの加速技術によってその速度を向上させられるか。
  • RQ3滑らかなPL関数を最小化する問題の複雑さは、滑らかな強い凸関数を最小化する問題の複雑さと、1次オラクルの複雑さという観点から本質的に異なるか。
  • RQ4勾配降下法よりも定数倍以上速く収束できないような、硬い例(ハードインスタンス)を構築できるか。

主な発見

  • 任意の1次アルゴリズムは、$L$-スムーズかつ $\mu$-PL 条件を満たす関数を最小化するため、$\varepsilon$-近似解を得るために少なくとも $\Omega\left(\frac{L}{\mu}\log\frac{1}{\varepsilon}\right)$ 回の勾配評価を必要とする。
  • この下界は、標準的な勾配降下法の収束速度と一致しており、滑らかなPL関数を最小化する上で勾配降下法が定数倍の差異を除いて最適であることを証明している。
  • この結果により、強い凸関数では実際に収束を加速できるモーメンタムに基づく加速手法が、一般の滑らかなPL関数に対してはより速い多項式的レートを達成できないことが示された。
  • 本論文は、座標を逐次的に解消する必要が生じる「ゼロチェーン」関数を用いて、硬いインスタンスを構築した。これにより、変数間で並列的または加速的な進捗が妨げられる。
  • この下界は次元に依存せず、高次元の設定でも成り立つ。これは、$L$-スムーズかつ $\mu$-PL 関数のクラス上でミニマックス解析を用いて導出された。
  • 解析により、強い凸性よりも弱いPL条件であっても、1次法では克服できない根本的な複雑さの障壁が存在することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。