[論文レビュー] Model-based Reinforcement Learning for Continuous Control with Posterior Sampling
本稿では、ニューラルネットワーク特徴量におけるベイジアン線形回帰を用いて事後分布サンプリングを行うことで、探索を改善する連続制御のためのモデルベース強化学習アルゴリズム、MPC-PSRLを提案する。線形MDPにおいては、$ ilde{O}(H^{3/2}deta{T})$ のレグレットバウンドを達成し、従来のモデルベース手法よりもサンプル効率が高く、収束時にモデルフリー性能と同等となる。
Balancing exploration and exploitation is crucial in reinforcement learning (RL). In this paper, we study model-based posterior sampling for reinforcement learning (PSRL) in continuous state-action spaces theoretically and empirically. First, we show the first regret bound of PSRL in continuous spaces which is polynomial in the episode length to the best of our knowledge. With the assumption that reward and transition functions can be modeled by Bayesian linear regression, we develop a regret bound of $ ilde{O}(H^{3/2}d\sqrt{T})$, where $H$ is the episode length, $d$ is the dimension of the state-action space, and $T$ indicates the total time steps. This result matches the best-known regret bound of non-PSRL methods in linear MDPs. Our bound can be extended to nonlinear cases as well with feature embedding: using linear kernels on the feature representation $ϕ$, the regret bound becomes $ ilde{O}(H^{3/2}d_ϕ\sqrt{T})$, where $d_ϕ$ is the dimension of the representation space. Moreover, we present MPC-PSRL, a model-based posterior sampling algorithm with model predictive control for action selection. To capture the uncertainty in models, we use Bayesian linear regression on the penultimate layer (the feature representation layer $ϕ$) of neural networks. Empirical results show that our algorithm achieves the state-of-the-art sample efficiency in benchmark continuous control tasks compared to prior model-based algorithms, and matches the asymptotic performance of model-free algorithms.
研究の動機と目的
- 連続制御における探索の理論的裏付けと計算的に実行可能な手法を、事後分布サンプリングを用いて開発すること。
- エピソード長Hに関して多項式的で、Tに関して非線形な、連続状態・行動空間におけるPSRLのレグレットバウンドを確立すること。
- ベイジアン関数近似を用いてモデルの不確実性をより良く捉えることで、モデルベースRLにおけるサンプル効率を向上させること。
- 事後分布サンプリングとモデル予測制御(MPC)を組み合わせた手法が、連続制御タスクにおいてモデルフリー性能と同等またはそれを上回ることを実証すること。
提案手法
- 各エピソードごとに事後分布から1つのMDPをサンプリングすることで、連続MDPにおける事後分布サンプリングによる強化学習(PSRL)を実装する。
- ニューラルネットワークの最終から2番目の層に対してベイジアン線形回帰を適用し、遷移関数と報酬関数をモデル化することで、特徴空間における不確実性を捉える。
- 行動選択にはモデル予測制御(MPC)を採用し、全エピソードにわたってサンプリングされたMDPを最適化する。
- カーネル化された特徴量(例:表現φ上の線形カーネル)を用いることで、非線形MDPに対しても結果を拡張し、レグレットバウンドを$\tilde{O}(H^{3/2}d_{\phi}\sqrt{T})$ に保証する。
- モデルの事後分布を活用することで、信頼集合の最適化を必要とせず、自然に探索と活用のバランスを取る。
- UCBスタイルの信頼集合最適化の計算負荷を回避するため、不確実性の定量化にベイジアンアプローチを採用する。
実験結果
リサーチクエスチョン
- RQ1連続制御におけるPSRLは、Hに関して多項式的でTに関して非線形な、最良のUCBベースのバウンドと同等のレグレットバウンドを達成できるか?
- RQ2ベイジアン関数近似を用いた事後分布サンプリングは、UCBベースの手法と比較して、計算効率と統計的パフォーマンスの両面で優れているか?
- RQ3事後分布サンプリングとMPCを組み合わせたモデルベースRLは、連続制御ベンチマークにおいて、既存のモデルベースおよびモデルフリー手法よりもサンプル効率に優れているか?
- RQ4深層ネットワークの特徴表現層でベイジアン線形回帰による不確実性モデリングが、性能に与える影響は何か?
主な発見
- 本稿では、連続MDPにおけるPSRLのための最初のレグレットバウンド$ ilde{O}(H^{3/2}deta{T})$ を確立し、線形MDPにおける最良のUCBベースのバウンドと同等であることを示した。
- 特徴量埋め込みを用いることで、非線形MDPに対しても結果を拡張でき、表現空間上で線形カーネルを用いる場合、$ ilde{O}(H^{3/2}d_{\phi}\sqrt{T})$ のバウンドが得られる。
- MPC-PSRLは、確率的連続制御ベンチマーク(連続Cartpoleやノイズ付きのPendulum Swing Upを含む)において、最先端のサンプル効率を達成した。
- 7-DOF ReacherおよびPusherタスクでは、オラクル報酬が利用可能な状況で、PETSやMBPOを上回り、収束が早く、最終的なパフォーマンスも優れた。
- 動的モデルと報酬関数の両方が未知の状況では、MPC-PSRLは従来のモデルベースおよびモデルフリー手法を著しく上回り、SACと同等の漸近的パフォーマンスを達成した。
- 結果から、ニューラルネットワーク特徴量における事後分布サンプリングによる不確実性モデリングが、PETS や MBPO などのアンサンブルベース手法よりも優れた探索を実現することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。