[論文レビュー] Multi-Point Bandit Algorithms for Nonstationary Online Nonconvex Optimization
本稿は、非定常なオンライン非凸最適化のためのマルチポイント・バンディットアルゴリズムを導入し、1次および2次停留所解および関数値に基づく新たなレグレット測度を提案する。低次元および高次元設定の両方で非線形レグレットバウンドを確立し、弱い擬似凸関数および単調的弱いサブモジュラ関数に対して定数レグレットの結果を含む。2次のガウス・シュタインの恒等式を用いたヘッセ行列推定のためのバンディット版立方正則化ニュートン法を開発する。
Bandit algorithms have been predominantly analyzed in the convex setting with function-value based stationary regret as the performance measure. In this paper, motivated by online reinforcement learning problems, we propose and analyze bandit algorithms for both general and structured nonconvex problems with nonstationary (or dynamic) regret as the performance measure, in both stochastic and non-stochastic settings. First, for general nonconvex functions, we consider nonstationary versions of first-order and second-order stationary solutions as a regret measure, motivated by similar performance measures for offline nonconvex optimization. In the case of second-order stationary solution based regret, we propose and analyze online and bandit versions of the cubic regularized Newton's method. The bandit version is based on estimating the Hessian matrices in the bandit setting, based on second-order Gaussian Stein's identity. Our nonstationary regret bounds in terms of second-order stationary solutions have interesting consequences for avoiding saddle points in the bandit setting. Next, for weakly quasi convex functions and monotone weakly submodular functions we consider nonstationary regret measures in terms of function-values; such structured classes of nonconvex functions enable one to consider regret measure defined in terms of function values, similar to convex functions. For this case of function-value, and first-order stationary solution based regret measures, we provide regret bounds in both the low- and high-dimensional settings, for some scenarios.
研究の動機と目的
- 動的レグレット測度を用いた非定常なオンライン非凸最適化のためのバンディットアルゴリズムの欠如に対処すること。
- 凸設定からの停留所レグレット解析を一般および構造的非凸関数に対して非凸設定へ拡張すること。
- 勾配情報が利用できない状況でも、関数値フィードバックからの勾配およびヘッセ行列の推定が可能なバンディットフレンドリーな手法を開発すること。
- 低次元設定では次元に多項式的に依存し、高次元スパース設定では多対数的に依存するレグレットバウンドを提供すること。
- 確率的および非確率的フィードバックの下で、1次および2次停留所解および関数値に基づく非定常レグレットを分析すること。
提案手法
- 勾配の大きさおよび2次停留所解に基づく非定常レグレット測度を提案し、オフライン非凸最適化の概念をオンラインバンディット設定へ拡張する。
- 関数値フィードバックからのヘッセ行列推定に、2次のガウス・シュタインの恒等式を用いたバンディット版立方正則化ニュートン法を導入する。
- 明示的な勾配情報が得られない状況において、ランダムな摂動を用いたマルチポイント勾配推定により、勾配およびヘッセ行列を近似する。
- 低次元および高次元設定の両方におけるレグレットバウンドを導出する。後者では、次元に多対数的依存を達成するために構造的スパarsity仮定を用いる。
- オンライン更新における誤差伝搬を制御するため、条件付き期待値およびマルティングル・差分列を用いた確率的近似フレームワークを採用する。
- 滑らかさ、勾配の有界性、および最適点の全変動(total variation)による非定常性の仮定を用いて、タイトなレグレットバウンドを導出する。
実験結果
リサーチクエスチョン
- RQ1一般の非凸関数に対して、バンディット設定における非定常レグレットを意味的に定義し、バウンド可能か?
- RQ2関数値フィードバックのみのバンディット設定で、2次停留所解をどのように近似できるか?
- RQ3弱い擬似凸性やサブモジュラリティなどの構造的仮定の下で、非定常非凸バンディット最適化における次元依存のレグレットバウンドは何か?
- RQ4構造的非凸関数に対して、バンディットアルゴリズムが非定常設定で定数レグレットを達成可能か?
- RQ52次情報(ヘッセ行列推定)の使用が、バンディット非凸最適化における収束性および停留所解回避にどのように寄与するか?
主な発見
- 本稿は、勾配の大きさに基づくレグレットを用いた非定常バンディット最適化に対して、O(d√(T + TV_T)) のレグレットバウンドを確立し、確率的および決定的設定の両方で有効であることを示す。
- 弱い擬似凸関数に対しては、スパarsity仮定の下で次元に多対数的に依存するレグレットバウンドを達成し、高次元への適用可能性を実現する。
- バンディット立方正則化ニュートン法は、2次停留所解の観点から非線形レグレットを達成し、停留所解回避に関する理論的保証を有する。
- 単調的弱いDR-サブモジュラ関数に対しては、関数値の観点からレグレットバウンドを導出し、曲率パラメータγへの明示的依存を示す。
- 同じ仮定の下で、確率的および決定的設定の間でレグレットバウンドが不変であることが示され、フィードバックノイズに対してロバストであることが示される。
- 分析により、構造的スパarsity仮定を用いることで、次元依存性を多項式から多対数的へと低減でき、高次元問題へのスケーラビリティが可能になることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。