[論文レビュー] On Online Learning in Kernelized Markov Decision Processes
本稿では、連続状態および連続行動のマルコフ決定過程(MDP)におけるオンライン強化学習のためのGP-UCRLおよび事後分布サンプリングアルゴリズムを提案する。ガウス過程の事前分布を用いて滑らかな遷移関数と報酬関数をモデル化する。新たなカーネル依存型情報ゲイン指標に基づく、非線形でサブ線形なレギュレートバウンドを確立し、MDPへのカーネルバンディット結果の一般化を達成し、非パラメトリックなカーネル化MDPにおける最初の頻度主義的レギュレート保証を提供する。
We consider online learning for minimizing regret in unknown, episodic Markov decision processes (MDPs) with continuous states and actions. We develop variants of the UCRL and posterior sampling algorithms that employ nonparametric Gaussian process priors to generalize across the state and action spaces. When the transition and reward functions of the true MDP are members of the associated Reproducing Kernel Hilbert Spaces of functions induced by symmetric psd kernels (frequentist setting), we show that the algorithms enjoy sublinear regret bounds. The bounds are in terms of explicit structural parameters of the kernels, namely a novel generalization of the information gain metric from kernelized bandit, and highlight the influence of transition and reward function structure on the learning performance. Our results are applicable to multidimensional state and action spaces with composite kernel structures, and generalize results from the literature on kernelized bandits, and the adaptive control of parametric linear dynamical systems with quadratic costs.
研究の動機と目的
- 連続状態および連続行動を有するエピソード的MDPにおけるオンライン学習アルゴリズムの開発を目的とし、ダイナミクスと報酬が再生核ヒルベルト空間(RKHS)に属する滑らかな関数であることを想定する。
- 特に、情報ゲイン指標を含むカーネルバンディット結果の拡張を、時間的かつ状態依存的なMDPの設定に適用する。
- 頻度主義的設定下で、カーネル化MDPにおけるオンラインRLの有限時間・高確率的レギュレートバウンドを提供すること。
- パラメトリックLQRおよびUCRL/PSRLの既存結果を、非パラメトリックで無限次元的、かつカーネル構造を持つMDPに一般化すること。
- RKHS値をとるマルティンググールの濃度不等式を活用し、理論的保証を導出すること。
提案手法
- 連続MDPにおける未知の遷移関数および報酬関数をモデル化するために、ガウス過程事前分布を用いたGP-UCRLおよび事後分布サンプリング(PSRL)の変種を提案する。
- 真の遷移関数および報酬関数を、対称正定値カーネルによって誘導されるRKHSの要素としてモデル化することで、状態と行動の間で非パラメトリックな一般化を可能にする。
- T回の相互作用後に得られる真のダイナミクスおよび報酬に関する最大情報量を捉える、MDPのための情報ゲインの新しい一般化(γT(R) および γmT(P))を定義する。
- 後件分散とカーネル構造に依存する、値関数とポリシーのレギュレートにおける推定誤差を制御するため、RKHS値をとるマルティングルの濃度不等式を用いる。
- GP後件分散と信頼区間幅パrameter βR,l および βP,l を用いて、真の報酬関数および遷移関数の高確率的信頼集合を構築する。
- 最適ポリシーと学習済みポリシーの価値の差を、報酬関数および遷移関数の推定誤差に分解し、それぞれをカーネル固有の情報ゲイン項でバウンドすることで、レギュレートバウンドを導出する。
実験結果
リサーチクエスチョン
- RQ1真の遷移関数および報酬関数が滑らかでRKHSに属する連続状態・連続行動MDPにおけるオンライン強化学習が、サブ線形なレギュレートを達成できるか?
- RQ2カーネルの選択がカーネル化MDPにおけるレギュレート性能に与える影響は何か?これは一般化された情報ゲイン指標を用いて定量的に評価可能か?
- RQ3カーネルバンディットの理論的枠組みを、状態の時間的進化と有限ホライズン計画を伴うMDPの逐次意思決定設定に拡張可能か?
- RQ4GP-UCRLおよび事後分布サンプリングのカーネル化MDPにおける有限時間のレギュレートバウンドは何か?また、カーネルの構造的性質にどのように依存するか?
- RQ5RKHS値をとる過程のための濃度不等式を活用して、非パラメトリックMDPにおける高確率的レギュレートバウンドを導出可能か?
主な発見
- GP-UCRLのレギュレートは、高確率的に Õ(γT(R) + γmT(P))√T でバウンドされる。ここで、γT(R) および γmT(P) は報酬関数および遷移関数のための新しい情報ゲイン指標である。
- 二乗指数カーネルの場合、情報ゲイン項 γT(R) および γmT(P) は polylog(T) のオーダーに比例し、d次元の状態および行動空間ではレギュレートバウンドが Õ(√T log^d T) にまで低下する。
- 事後分布サンプリングアルゴリズム(PSRL)は、高確率的に O(αR,τ exp(γH−1(kR,Z))√(γT(kR,Z)T)) + O(αP,τ exp(γmH−1(kP,Z̃))√(γmT(kP,Z̃)T)) のベイズ的レギュレートバウンドを達成する。
- レギュレートバウンドは、情報ゲインを通じてカーネル構造に明示的に依存しており、滑らかさの高いカーネル(例:二乗指数カーネル)がより優れたレギュレート性能をもたらすことを示している。
- 本分析により、カーネルバンディット結果がMDPに一般化され、パラメトリックLQRのレギュレートバウンドが、無限次元関数空間を持つ非パラメトリックなカーネルベースMDPに拡張された。
- 本結果は、カーネル化MDPにおけるオンライン学習に対する最初の頻度主義的レギュレート保証を提供し、滑らかさ仮定に基づく非パラメトリックRLの理論的基盤を確立した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。