[論文レビュー] Provable Model-based Nonlinear Bandit and Reinforcement Learning: Shelve Optimism, Embrace Virtual Curvature
この論文は、仮想曲率を用いて、楽観主義ではなく、近似的な局所最大値への収束を保証するモデルベースのアルゴリズムであるViOlinを提案する。サンプル複雑性の境界が、モデルクラスの逐次ラデマッハ複雑性にのみ依存することを示しており、1層のニューラルネットを用いた決定的報酬の下でも、グローバル収束は統計的に不成立であることを示している。
This paper studies model-based bandit and reinforcement learning (RL) with nonlinear function approximations. We propose to study convergence to approximate local maxima because we show that global convergence is statistically intractable even for one-layer neural net bandit with a deterministic reward. For both nonlinear bandit and RL, the paper presents a model-based algorithm, Virtual Ascent with Online Model Learner (ViOlin), which provably converges to a local maximum with sample complexity that only depends on the sequential Rademacher complexity of the model class. Our results imply novel global or local regret bounds on several concrete settings such as linear bandit with finite or sparse model class, and two-layer neural net bandit. A key algorithmic insight is that optimism may lead to over-exploration even for two-layer neural net model class. On the other hand, for convergence to local maxima, it suffices to maximize the virtual return if the model can also reasonably predict the size of the gradient and Hessian of the real return.
研究の動機と目的
- 非線形バンディットおよび強化学習におけるグローバル収束の統計的不成立性を解決すること。
- 1層のニューラルネットバンディットにおいてグローバル最適化が保証的に不成立であることを踏まえ、目的をグローバル最適化から近似的な局所最大値への収束に再定式化すること。
- モデルクラスの逐次ラデマッハ複雑性に多項式的に依存するサンプル複雑性を有するモデルベースのアルゴリズムを設計すること。
- 楽観主義による探索が非線形設定で過剰探索を引き起こすのに対し、仮想曲率が効率的な収束を可能にすることを示すこと。
- 線形バンディット(有限/スパースモデル)および2層のニューラルネットバンディットを含む具体的な設定における、保証されたレグレット境界を提供すること。
提案手法
- モデル予測された勾配とヘッセ行列に基づく仮想リターンを最大化するモデルベースのアルゴリズムであるViOlin(Virtual Ascent with Online Model Learner)を提案する。
- モデルクラスの複雑性を測るため、報酬およびダイナミクスモデルクラスの逐次ラデマッハ複雑性を用い、サンプル複雑性の境界の根拠を構築する。
- 楽観主義に基づく探索を、真のリターン関数のヘッセ行列と勾配のモデル予測を活用する曲率に配慮した更新に置き換える。
- 真のダイナミクスとモデルのダイナミクス間の価値差を関連付けるシミュレーション補題を用い、誤差の伝播を制御する。
- 決定的ダイナミクス下で勾配更新と価値関数の改善を結びつけるポリシー勾配補題を導入する。
- ガウススムージングとテレスコピング技術を用いて、モデルと真のパラメータを含む双線形形式の差をバウンディングする。
実験結果
リサーチクエスチョン
- RQ11層のニューラルネット報酬を有する非線形バンディット問題において、グローバル収束は統計的に可能か?
- RQ2グローバル収束が不成立である場合、モデルベースの強化学習アルゴリズムは、局所最大値へのサンプル効率的収束を達成できるか?
- RQ3楽観主義による探索は、非線形関数近似設定で過剰探索を引き起こすか?
- RQ4予測された勾配とヘッセ行列に基づく仮想曲率は、効率的探索のための楽観主義の代替として機能できるか?
- RQ5モデルクラスの複雑性の観点から、モデルベースの非線形バンディットおよび強化学習アルゴリズムのサンプル複雑性は何か?
主な発見
- 1層のニューラルネットバンディットで報酬が決定的であっても、グローバル収束は入力次元に指数関数的に依存するため、統計的に不成立である。
- 提案されたViOlinアルゴリズムは、モデルクラスの逐次ラデマッハ複雑性に多項式的に依存するサンプル複雑性を有し、近似的な局所最大値への保証された収束を達成する。
- 有限またはスパースなモデルクラスを有する線形バンディットでは、ViOlinはモデルクラスサイズの対数に比例する局所レグレット境界を達成する。
- 2層のニューラルネットバンディットでは、アルゴリズムはモデルの逐次ラデマッハ複雑性に依存する局所レグレット境界を達成するが、入力次元に依存しない。
- 理論的分析により、楽観主義は非線形設定で過剰探索を引き起こす一方、仮想曲率はより効率的で安定した収束を可能にすることが示された。
- 本研究では、1層のニューラルネットが多項式的に有界なエリューダー次元を持たないことが証明され、非線形ダイナミクスに対する従来の複雑性測度が無効であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。