Skip to main content
QUICK REVIEW

[論文レビュー] Global Convergence of Arbitrary-Block Gradient Methods for Generalized Polyak-Łojasiewicz Functions

Dominik Csiba, Peter Richtárik|arXiv (Cornell University)|Sep 9, 2017
Stochastic Gradient Optimization Techniques参考文献 11被引用数 15
ひとこと要約

本稿では、2つの主要なイノベーション、すなわちブロック選択ルールのための割合関数と弱いポリャク=ロジャツェフスキー(WPL)条件を用いて、非凸最適化問題における任意ブロック勾配法の分析のための統一的枠組みを導入する。滑らかでない場合を含む広範な非凸関数クラスにおけるグローバル収束を確立し、グリーディミニバッチ選択の新しい収束レートと、既存の手法を一つの理論的枠組みで統合する。

ABSTRACT

In this paper we introduce two novel generalizations of the theory for gradient descent type methods in the proximal setting. First, we introduce the proportion function, which we further use to analyze all known (and many new) block-selection rules for block coordinate descent methods under a single framework. This framework includes randomized methods with uniform, non-uniform or even adaptive sampling strategies, as well as deterministic methods with batch, greedy or cyclic selection rules. Second, the theory of strongly-convex optimization was recently generalized to a specific class of non-convex functions satisfying the so-called Polyak-Łojasiewicz condition. To mirror this generalization in the weakly convex case, we introduce the Weak Polyak-Łojasiewicz condition, using which we give global convergence guarantees for a class of non-convex functions previously not considered in theory. Additionally, we establish (necessarily somewhat weaker) convergence guarantees for an even larger class of non-convex functions satisfying a certain smoothness assumption only. By combining the two abovementioned generalizations we recover the state-of-the-art convergence guarantees for a large class of previously known methods and setups as special cases of our general framework. Moreover, our frameworks allows for the derivation of new guarantees for many new combinations of methods and setups, as well as a large class of novel non-convex objectives. The flexibility of our approach offers a lot of potential for future research, as a new block selection procedure will have a convergence guarantee for all objectives considered in our framework, while a new objective analyzed under our approach will have a whole fleet of block selection rules with convergence guarantees readily available.

研究の動機と目的

  • 強凸およびPL条件を超えて、弱凸および非凸設定における勾配型手法の収束理論を一般化すること。
  • 均一、非均一、適応的、巡回的、グリーディなど、あらゆるブロック選択戦略を、割合関数を用いた統一的分析枠組みで統合すること。
  • 弱いポリャク=ロジャツェフスキー(WPL)条件を満たす非凸関数の新規クラスに対して、グローバル収束の保証を確立すること。
  • WPL 条件および滑らかさの仮定の下で、グリーディミニバッチなど新たなブロック選択ルールのための新しい収束レートを導出すること。
  • 収束保証の移植可能性を可能にすること:新しいブロックルールは、フレームワーク内のすべての目的関数に対して保証を継承可能であり、逆に、目的関数に対しても同様の保証が適用可能となる。

提案手法

  • すべての既知および新しいブロック選択ルール(均一、非均一、適応的、巡回的、グリーディ)を統一的に分析できるように、割合関数を導入する。
  • 古典的PL不等式を弱凸関数へ一般化するための弱いポリャク=ロジャツェフスキー(WPL)条件を提案する。定義は $\|\nabla f(\mathbf{x})\| \cdot \|\mathbf{x}-\mathbf{x}^*\| \geq \sqrt{\mu} \cdot \xi(\mathbf{x})$ である。
  • 割合関数と強制関数に基づく一般的な降下補題を確立し、さまざまなブロック選択ルールの下での収束を分析する。
  • WPL 条件の下で滑らかでない問題に対しても、収束レートを導出する。特に、グリーディミニバッチの場合は $K \geq \frac{\xi(\mathbf{x}^0)}{\epsilon \lambda_{\min}(\mathbb{E}[\mathbf{M}_{[S]}^{-1}])} \log\left(\frac{\xi(\mathbf{x}^0)}{\epsilon}\right)$ が得られる。
  • この枠組みを用いて、既知の手法(例:確率的、巡回的、グリーディ)の最良水準の収束レートを回復し、これまで分析されていなかった手法と目的関数の組み合わせに対しても新たな保証を導出する。
  • 数値実験を通じて、滑らかでない設定でもグローバル収束が有効であることを検証し、WPL 条件下での勾配ノルムの局所収束を確認する。

実験結果

リサーチクエスチョン

  • RQ1一様な分析枠組みを用いて、任意のブロック選択ルールにわたるブロック座標降下法の収束理論を統一できるか?
  • RQ2弱いポリャク=ロジャツェフスキー(WPL)条件は、古典的PL条件を超えて、より広範な非凸関数クラスに対するグローバル収束保証を可能にするか?
  • RQ3グリーディミニバッチのような新たなブロック選択戦略を厳密に分析し、競争力のある収束レートを達成できることを示せるか?
  • RQ4WPL 条件下での滑らかでない問題と滑らかな問題の収束レートは何か? また、既存の手法と比較するとどうなるか?
  • RQ5この枠組みは、証明を再導出することなく、新しいブロック選択ルールと非凸目的関数の組み合わせに対しても収束保証を提供できるか?

主な発見

  • 弱いポリャク=ロジャツェフスキー(WPL)条件は、古典的PL不等式を弱凸関数へ一般化し、より広範な非凸問題クラスにおけるグローバル収束を可能にする。
  • WPL 条件の下で滑らかな問題に対して、グリーディミニバッチ選択は $K \geq \frac{\xi(\mathbf{x}^0)}{\epsilon \lambda_{\min}(\mathbb{E}[\mathbf{M}_{[S]}^{-1}])} \log\left(\frac{\xi(\mathbf{x}^0)}{\epsilon}\right)$ の収束レートを達成する。これは、このサンプリング戦略に対しては新規の結果である。
  • 滑らかでない問題に対しては、割合関数が $K \geq \frac{\xi(\mathbf{x}^0)nL_{\tau}}{\tau\epsilon} \log\left(\frac{\xi(\mathbf{x}^0)}{\epsilon}\right)$ のレートを導出し、WPL フレームワーク下での新たな収束保証を提供する。
  • この枠組みは、既知の手法(例:確率的、巡回的、グリーディ)の最良水準の収束レートを特別なケースとして回復し、その一般性を示している。
  • 数値実験により、滑らかでない非凸問題に対しても、シリアル座標降下法がグローバル収束することを確認した。また、WPL 条件下での勾配ノルムの局所収束も検証された。
  • 理論的保証として、$K$ 回の反復内で、最適性ギャップ $\xi(\mathbf{x}^K) \leq \epsilon$ または勾配ノルム $\lambda(\mathbf{x}^k) \leq \epsilon$ が達成されることを保証しており、非凸領域における実用的収束を保証する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。