Skip to main content
QUICK REVIEW

[論文レビュー] Regret minimization in stochastic non-convex learning via a proximal-gradient approach

Nadav Hallak, Panayotis Mertikopoulos|arXiv (Cornell University)|Oct 13, 2020
Advanced Bandit Algorithms Research参考文献 34被引用数 7
ひとこと要約

本稿は、第一順序オракルのフィードバックを用いて局所的レジーットを最小化する、制約付きで非凸な確率的最適化のためのプロキシマル・グラディエント(prox-grad)法を提案する。この手法により、最小最大の順序最適なレジーットバウンドを達成し、新しいプロキシマル・グラディエントスキームを介してオンラインとオフラインの非凸な確率的最適化を結びつける。その複雑さの保証は、分散低減手法と一致する。

ABSTRACT

Motivated by applications in machine learning and operations research, we study regret minimization with stochastic first-order oracle feedback in online constrained, and possibly non-smooth, non-convex problems. In this setting, the minimization of external regret is beyond reach for first-order methods, so we focus on a local regret measure defined via a proximal-gradient mapping. To achieve no (local) regret in this setting, we develop a prox-grad method based on stochastic first-order feedback, and a simpler method for when access to a perfect first-order oracle is possible. Both methods are min-max order-optimal, and we also establish a bound on the number of prox-grad queries these methods require. As an important application of our results, we also obtain a link between online and offline non-convex stochastic optimization manifested as a new prox-grad scheme with complexity guarantees matching those obtained via variance reduction techniques.

研究の動機と目的

  • オンラインで制約付き、非滑らかで非凸な最適化において、確率的第一順序オラクルフィードバックを用いたレジーット最小化の課題に対処すること。
  • 局所的レジーットを達成するプロキシマル・グラディエントアルゴリズムを考案すること。これは、プロキシマル・グラディエント写像を介して定義される。
  • 確率的フィードバックと制約のもとで、提案手法の最小最大の順序最適性を確立すること。
  • 必要な確率的第一順序オラクル(SFO)クエリの数に関する複雑さの境界を導出すること。
  • 複雑さの保証が一致するプロキシマル・グラディエントスキームを通じて、オンラインとオフラインの非凸な確率的最適化の間の新しい接続を確立すること。

提案手法

  • 本稿は、確率的第一順序フィードバックに基づくプロキシマル・グラディエント法を提案し、局所的レジーットの測定にサイズ $ w $ のスライディングウインドウを用いる。
  • 非滑らかさと制約を扱うためにプロキシマル・グラディエント写像を導入し、内部ループの反復にデセント補題を適用する。
  • 内部ループにおける停止基準を勾配とステップサイズの条件に基づき定義し、目的関数の十分な減少を保証する。
  • リプシッツ滑らか性、勾配の有界性、確率的勾配における分散の有界性という仮定の下で手法を分析する。
  • 重要な要素として、局所的レジーットコンパレータを定義するためにスライディングウインドウ平均 $ S_{t,w}({f x}) $ を用いる。これにより、局所的最適性の追跡が可能になる。
  • ヤングの不等式とデセント補題を用いて理論的境界を導出し、プロキシマル・グラディエントの期待二乗ノルムに関する境界を得る。

実験結果

リサーチクエスチョン

  • RQ1確率的第一順序フィードバックを用いたオンラインで制約付き、非滑らかで非凸な最適化において、局所的レジーットを達成できるか?
  • RQ2提案されたプロキシマル・グラディエント法は、レジーットとSFOクエリの複雑さの観点から最小最大の順序最適性を満たすか?
  • RQ3オンラインの局所的レジーットフレームワークは、同等の複雑さの保証を持つオフライン非凸な確率的最適化と結びつけられるか?
  • RQ4反復回数 $ au $ に対して $ ilde{O}( au) $ の複雑さを達成するための確率的第一順序オラクル呼び出し回数はどの程度か?
  • RQ5確率的設定において、分散が有界で、リプシッツ滑らか性の仮定が成り立つ場合、この手法はどのように動作するか?

主な発見

  • 提案されたプロキシマル・グラディエント法は、局所的レジーットバウンド $ Oig(( au^2 + au)/w^2ig) $ を達成し、これは最小最大の順序最適である。
  • プロキシマル・グラディエントの期待二乗ノルムは、$ rac{2}{(T-w)w^2}ig(( au^2 + au)T + 6V_w[T]ig) $ で有界であり、定常性への収束を保証する。
  • 確率的第一順序オラクル(SFO)の呼び出し回数は、$ O(M au ho^{-3/2}) $ で有界であり、ここで $ ho $ は所望の精度、$ M $ は問題パラメータである。
  • この手法は、オフライン非凸な確率的最適化における分散低減手法と同等の複雑さの保証を達成する。
  • SFO呼び出し回数のバウンドは、内部ループにおけるデセントの議論により導出され、1回の外部反復あたり $ O(w) $ 回の呼び出しであることが示される。
  • 分析により、この手法は確率的勾配に対してロバストであり、ややいなごろしの正則性条件のもとで、非線形のレジーットを維持することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。