Skip to main content
QUICK REVIEW

[論文レビュー] Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models

Łukasz Szpruch, Tanut Treetanthiploet|arXiv (Cornell University)|Dec 19, 2021
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

本稿は、未知のパラメータを伴う線形・凸型ダイナミクスを有する連続時間エピソード的強化学習のための確率的フレームワークを構築する。推定されたと真のモデルパラメータの間の性能ギャップが2次的であることを確立し、その結果、探索と活用を最適にバランスさせる段階的学習アルゴリズムを設計した。このアルゴリズムは、$Ó(\sqrt{N}\ln N)$ の高確率的リグレットと、$Ó((\ln N)^2)$ の期待リグレットを、$N$ エピソードの間に達成する。これは、相関する連続時間観測に対する新しい集中不等式を用いることで実現された。

ABSTRACT

We develop a probabilistic framework for analysing model-based reinforcement learning in the episodic setting. We then apply it to study finite-time horizon stochastic control problems with linear dynamics but unknown coefficients and convex, but possibly irregular, objective function. Using probabilistic representations, we study regularity of the associated cost functions and establish precise estimates for the performance gap between applying optimal feedback control derived from estimated and true model parameters. We identify conditions under which this performance gap is quadratic, improving the linear performance gap in recent work [X. Guo, A. Hu, and Y. Zhang, arXiv preprint, arXiv:2104.09311, (2021)], which matches the results obtained for stochastic linear-quadratic problems. Next, we propose a phase-based learning algorithm for which we show how to optimise exploration-exploitation trade-off and achieve sublinear regrets in high probability and expectation. When assumptions needed for the quadratic performance gap hold, the algorithm achieves an order $\mathcal{O}(\sqrt{N} \ln N)$ high probability regret, in the general case, and an order $\mathcal{O}((\ln N)^2)$ expected regret, in self-exploration case, over $N$ episodes, matching the best possible results from the literature. The analysis requires novel concentration inequalities for correlated continuous-time observations, which we derive.

研究の動機と目的

  • 未知の線形ダイナミクスを伴う連続時間エピソード的強化学習におけるモデルベースの確率的フレームワークの構築。
  • コスト関数の正則性を分析し、推定パラメータと真のパラメータを用いた最適制御の間の性能ギャップを定量化する。
  • 性能ギャップが2次的である条件を確立し、先行研究の線形バウンドを改善する。
  • 探索と活用を最適にバランスさせる段階的学習アルゴリズムの設計。
  • 文献で達成されている最先端の結果と一致する高確率的および期待リグレットバウンドの導出。

提案手法

  • 未知のドリフトパラメータを伴う線形・凸型確率的制御問題におけるコスト関数の正則性を、確率的表現を用いて研究する。
  • 推定パラメータと真のパラメータに基づくフィードバック制御の性能ギャップの精密な推定を導出し、適切な条件下で2次的依存を示す。
  • 逐次ベイズ推定を用いて、探索フェーズと活用フェーズを交互に繰り返す段階的学習アルゴリズムを導入する。
  • 相関する連続時間観測に特化した新しい集中不等式を用いて、推定誤差とリグレットを分析する。
  • Lévyの特徴付けを用いて、フィルタリング過程がブラウン運動であることを示し、状態過程の半マルティンゲール表現を可能にする。
  • 進行的可測性およびマルティンゲールの性質を用いて、推定パラメータ $\hat{\bm{\theta}}^{\bm{\Psi},m}$ の ${\mathcal{G}}^{\bm{\Psi}}_m$-可測性を確立する。

実験結果

リサーチクエスチョン

  • RQ1推定パラメータと真のパラメータを用いた最適制御の性能ギャップが、線形的ではなく2次的にスケーリングする条件は何か?
  • RQ2未知の線形ダイナミクスを伴う連続時間エピソード的強化学習において、探索と活用をどのように最適にバランスさせるか?
  • RQ3相関する連続時間観測が存在する状況下で、段階的学習アルゴリズムが達成できるリグレットバウンドは何か?
  • RQ4従属する連続時間過程に特化した新しい集中不等式を導出し、強化学習に応用できるか?
  • RQ5線形・凸型制御問題において、モデルの不確実性、コスト関数の正則性、学習パフォーマンスの間にはどのような相互作用があるか?

主な発見

  • 適切な正則性条件下で、推定パラメータと真のパラメータを用いた最適フィードバック制御の性能ギャップは2次的であることが示され、先行研究の線形ギャップを改善する。
  • 2次ギャップ条件が成立する場合、提案された段階的アルゴリズムは、$N$ エピソードの間に $\mathcal{O}(\sqrt{N}\ln N)$ の高確率的リグレットを達成する。
  • 自己探索状況では、アルゴリズムは $\mathcal{O}((\ln N)^2)$ の期待リグレットを達成し、文献で知られている最高水準の結果と一致する。
  • 相関する連続時間観測に特化した新しい集中不等式が導入され、逐次学習における推定誤差のバウンドに不可欠である。
  • 観測フィルトレーションに関して状態過程の半マルティンゲール表現が確立され、推定パラメータの可測性および推論結果を厳密に導く。
  • 本フレームワークは、一般の凸型、場合によっては不規則なコスト関数(非滑らかで制約付きの制御を含む)に適用可能であり、線形・二次型モデルを超える拡張を可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。