Skip to main content
QUICK REVIEW

[論文レビュー] Posterior Sampling for Large Scale Reinforcement Learning

Georgios Theocharous, Zheng Wen|arXiv (Cornell University)|Nov 21, 2017
Advanced Bandit Algorithms Research参考文献 13被引用数 19
ひとこと要約

本稿では、大規模かつ連続的MDPに適した実用的でモデルに依存しないアルゴリズムとして、決定的スケジュール後方サンプリング強化学習(DS-PSRL)を提案する。この手法は、対数的で決定的なエピソード切り替えスケジュールを用いる。弱い仮定の下で、状態空間のサイズに依存しないベイジアンレグレットバウンドを達成でき、効率的な一般化を可能にし、離散的および連続的制御問題において最先端のPSRL手法を上回る性能を発揮する。

ABSTRACT

We propose a practical non-episodic PSRL algorithm that unlike recent state-of-the-art PSRL algorithms uses a deterministic, model-independent episode switching schedule. Our algorithm termed deterministic schedule PSRL (DS-PSRL) is efficient in terms of time, sample, and space complexity. We prove a Bayesian regret bound under mild assumptions. Our result is more generally applicable to multiple parameters and continuous state action problems. We compare our algorithm with state-of-the-art PSRL algorithms on standard discrete and continuous problems from the literature. Finally, we show how the assumptions of our algorithm satisfy a sensible parametrization for a large class of problems in sequential recommendations.

研究の動機と目的

  • 実世界の応用(例:順次推薦)に一般的に見られる非エピソード的かつリセットなしのMDPに対して、実用的でスケーラブルなPSRLアルゴリズムの欠如に対処する。
  • 表形式の表現に依存し、動的訪問回数に基づくエピソードスケジューリングに依存する既存のPSRL手法の制限を克服する。これは、連続的または高次元の状態・行動空間では実行不可能である。
  • パラメータ化されたMDP、特にスカラーパラメータを持つMDPに適用可能な、一般化可能なPSRLアルゴリズムを構築し、証明可能なベイジアンレグレット保証を提供する。
  • サンプル数、時間、空間の複雑さにおいて実用的で効率的でありながら、強力な理論的性能保証を維持する。
  • アルゴリズムの仮定が、広範な順次推薦システムのクラスで満たされることを示し、データ効率的で、短視眼的でないパーソナライゼーションを可能にする。

提案手法

  • 訪問回数などの動的統計に依存しない、対数的エピソード長の増加に基づく決定的でモデルに依存しないエピソード切り替えスケジュールを導入する。
  • 各エピソードの開始時に事後分布からモデルをサンプリングし、そのサンプルされたモデルの最適方策をエピソード終了まで実行する。
  • システムのダイナミクスがスカラーパラメータ(例:ユーザーが音楽を聴く傾向)に依存するパラメトリックモデルを用いることで、状態と行動の間で一般化を可能にする。
  • リプシッツ連続性と事後集中の仮定を適用し、状態空間のサイズに依存しないレグレットバウンドを導出する。
  • パラメータ化されたMDPの構造を活用して、各状態・行動のカウントを避けることで、連続的および高次元問題へのスケーラビリティを実現する。
  • 状態をリセットしない非エピソード的で継続的な学習フレームワークを採用し、推薦システムなどの実世界の応用に適している。

実験結果

リサーチクエスチョン

  • RQ1大規模で連続的かつ非エピソード的MDPに対して、理論的にも的確で実用的にも効率的なPSRLアルゴリズムを設計できるか?
  • RQ2対数的エピソード長の増加に基づく決定的エピソード切り替えスケジュールは、訪問回数などの動的統計に依存せず、強力なレグレット保証を達成できるか?
  • RQ3MDPのダイナミクスがスカラーパラメータでパラメータ化される場合、DS-PSRLのレグレットバウンドは状態数に依存しないか?
  • RQ4リプシッツダイナミクスと事後集中の仮定は、実世界の順次推薦システムでどの程度成立するか?
  • RQ5連続的および離散的制御タスクにおいて、DS-PSRLはサンプル効率性および累積レグレットの観点で、最先端のPSRLアルゴリズムと比較してどのように差をつけるか?

主な発見

  • 弱い仮定の下で、DS-PSRLは Õ(HS√(AT)) のベイジアンレグレットバウンドを達成する。状態数に依存しない。ダイナミクスがスカラーパラメータでパラメータ化される場合に成立する。
  • DS-PSRLは、線形二次レギュレータ(LQR)やPOI推薦タスクを含む、標準的な離散的および連続的制御問題において、最先端のPSRL手法を上回る性能を発揮する。
  • 実験結果から、DS-PSRLは最適パラメータ(例:A*, B*)を素早く学習する。1ステップごとのエピソード切り替えが良好に機能しており、多段階の探索の必要性が最小限であることが示唆される。
  • 摂動付き遷移確率を有するPOI推薦モデルは、リプシッツダイナミクスと事後集中の両方の仮定を満たしており、‖P(⋅|X,a,θ)−P(⋅|X,a,θ′)‖₁ ≤ (2/e)|θ−θ′| を満たす。
  • 真のパラメータθ*の推定誤差の期待二乗誤差は、maxⱼ𝔼[Nⱼ₋₁|θ*−θ̃ⱼ|²] = O(1) で有界であり、弱い条件下で事後集中が確認される。
  • アルゴリズムの決定的スケジュールにより、エピソード長が対数的に増加し、時間、サンプル、空間の複雑さが効率的になる。これにより、大規模で連続的問題に適した実装が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。