Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Stochastic Non-smooth Non-convex Optimization through Online-to-Non-convex Conversion

Ashok Cutkosky, Harsh Mehta|arXiv (Cornell University)|Feb 7, 2023
Stochastic Gradient Optimization Techniques被引用数 6
ひとこと要約

本稿では、非滑らかで非凸な確率的最適化をオンライン学習に還元する、画期的なオンラインから非凸への変換フレームワークを提案する。これにより、$(\delta,\epsilon)$-停留立点を求めるために、$O(\epsilon^{-3}\delta^{-1})$ 個の確率的勾配クエリで最適な複雑度を達成し、以前の最良レート $O(\epsilon^{-4}\delta^{-1})$ よりも向上する。この手法は、オンライン学習におけるシフトレジスト(shifted regret)の境界を活用して、滑らかでない目的関数のための高速なアルゴリズムを設計し、下界による最適性の証明も行う。

ABSTRACT

We present new algorithms for optimizing non-smooth, non-convex stochastic objectives based on a novel analysis technique. This improves the current best-known complexity for finding a $(δ,ε)$-stationary point from $O(ε^{-4}δ^{-1})$ stochastic gradient queries to $O(ε^{-3}δ^{-1})$, which we also show to be optimal. Our primary technique is a reduction from non-smooth non-convex optimization to online learning, after which our results follow from standard regret bounds in online learning. For deterministic and second-order smooth objectives, applying more advanced optimistic online learning techniques enables a new complexity of $O(ε^{-1.5}δ^{-0.5})$. Our techniques also recover all optimal or best-known results for finding $ε$ stationary points of smooth or second-order smooth objectives in both stochastic and deterministic settings.

研究の動機と目的

  • リLUベースのネットワークを含む現代のアーキテクチャでは標準的な滑らかさの仮定が成り立たないため、非滑らかで非凸な確率的最適化における理論的保証のギャップを埋める。
  • 非滑らかで非凸な設定における $(\delta,\epsilon)$-停留立点を求めるための最良状態の複雑度を向上させること。これは、現実のディープラーニングにより関連性がある。
  • 非凸な確率的最適化をオンライン学習に還元する形式的な還元を確立し、高速な収束を実現するための高度なオンライン学習のレジスト境界を活用できるようにする。
  • 新しい複雑度レート $O(\epsilon^{-3}\delta^{-1})$ が、すべての $\epsilon \leq O(\delta)$ に対して最適であることを証明し、重要な理論的ギャップを埋める。

提案手法

  • コアとなる手法は、非凸な確率的最適化問題を、確率的勾配から導かれる線形損失を用いてオンライン学習問題に変換するオンラインから非凸への変換である。
  • レジストが変化する比較基準(shifting comparators)の系列に対して測定される、オンライン学習におけるシフトレジスト境界を用いることで、反復のずれ(drift)を制御し、停留立点への収束を保証する。
  • 定期的なリセットを伴うオンライン勾配降下法(OGD)を適用し、$K$-シフトレジスト境界を $O(DGK\sqrt{T})$ として達成する。これは最終的な収束保証において極めて重要である。
  • オンラインからバッチへの変換を用いて、オンライン反復の系列から単一の点 $\overline{{\mathbf{w}}}^k$ を抽出し、すべての $t$ に対して $\|\overline{{\mathbf{w}}}^k - {\mathbf{w}}_t^k\| \leq \delta$ が成り立つようにし、$(\delta,\epsilon)$-停留立点条件を満たす。
  • オンラインレジストの構造と方向微分オラクルを用いて、局所的近傍における平均勾配の期待ノルムを制御することで、期待される部分最適性を制御する。
  • 下界を構築することで、$O(\epsilon^{-3}\delta^{-1})$ のレートが、同じ仮定のもとで、いかなるアルゴリズムよりも良い複雑度を達成できないことを示し、最適性を証明する。

実験結果

リサーチクエスチョン

  • RQ1非滑らかで非凸な確率的最適化において、$(\delta,\epsilon)$-停留立点を求めるための複雑度を $O(\epsilon^{-4}\delta^{-1})$ よりも良くできるか?
  • RQ2$O(\epsilon^{-3}\delta^{-1})$ の複雑度レートは最適であるか、それ以上に改善可能か?
  • RQ3オンラインから非凸への変換フレームワークを用いて、滑らかでない目的関数や2階微分可能(second-order smooth)な目的関数に対する既存の結果を統一的かつ改善できるか?
  • RQ4提案手法は、確率的および決定的設定の両方において、滑らかでないおよび2階微分可能な設定の最適または既知の最良レートを回復できるか?
  • RQ5オンライン学習と非凸最適化の関係を活用して、滑らかでない目的関数のためのより高速なアルゴリズムを設計できるか?

主な発見

  • 提案されたアルゴリズムは、$(\delta,\epsilon)$-停留立点を求めるために $O(\epsilon^{-3}\delta^{-1})$ の複雑度を達成し、以前の最良レート $O(\epsilon^{-4}\delta^{-1})$ よりも向上する。
  • $O(\epsilon^{-3}\delta^{-1})$ のレートが、すべての $\epsilon \leq O(\delta)$ に対して最適であることが証明され、上界と一致する根本的な下界を確立する。
  • 2階微分可能な目的関数では、高度な楽観的オンライン学習技術を用いて、$O(\epsilon^{-1.5}\delta^{-0.5})$ の複雑度を達成し、これも最適である。
  • このフレームワークは、確率的および決定的設定の両方において、滑らかでないおよび2階微分可能な目的関数のすべての最適または最良の結果を回復する。
  • オンラインからバッチへの変換により、最終反復 $\overline{{\mathbf{w}}}^k$ がその軌道から $\delta$-ボール内に位置することを保証し、$(\delta,\epsilon)$-停留立点条件を満たす。
  • 解析により、方向微分オラクルを用いても $O(\epsilon^{-3}\delta^{-1})$ のレートがタイトであることが確認され、連続微分可能な関数に対してもこの境界が成り立つことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。