Skip to main content
QUICK REVIEW

[論文レビュー] Multiple-Step Greedy Policies in Online and Approximate Reinforcement Learning

Yonathan Efroni, Gal Dalal|arXiv (Cornell University)|May 21, 2018
Reinforcement Learning in Robotics参考文献 15被引用数 7
ひとこと要約

本稿は、オンラインおよび近似強化学習における複数ステップのグリーディ方策—特に $h$-および $k$-グリーディ方策—を導入し、分析する。複数ステップのグリーディ方策におけるソフト方策更新は、1ステップグリーディ設定とは異なり、単調な改善を保証しないことが同定され、生成モデルまたは近似方策演算子の下で理論的収束保証を持つアルゴリズムが提案され、近似誤差および割引因子の観点から性能バウンドが確立される。

ABSTRACT

Multiple-step lookahead policies have demonstrated high empirical competence in Reinforcement Learning, via the use of Monte Carlo Tree Search or Model Predictive Control. In a recent work \cite{efroni2018beyond}, multiple-step greedy policies and their use in vanilla Policy Iteration algorithms were proposed and analyzed. In this work, we study multiple-step greedy algorithms in more practical setups. We begin by highlighting a counter-intuitive difficulty, arising with soft-policy updates: even in the absence of approximations, and contrary to the 1-step-greedy case, monotonic policy improvement is not guaranteed unless the update stepsize is sufficiently large. Taking particular care about this difficulty, we formulate and analyze online and approximate algorithms that use such a multi-step greedy operator.

研究の動機と目的

  • オンラインおよび近似学習のような実用的RL設定における複数ステップグリーディ方策の理論的保証の欠如に対処すること。
  • 重要な問題を同定する:1ステップグリーディの場合とは異なり、複数ステップグリーディ方策に対するソフト更新は、単調な方策改善を保証しないこと。
  • $h$-および $k$-グリーディ演算子を用いたオンラインおよび近似アルゴリズムの設計と分析を行い、収束性と性能バウンドを保証すること。
  • 生成モデルおよび近似方策の仮定の下で、近似誤差、割引因子、方策更新メカニズムの観点から性能保証を確立すること。

提案手法

  • 値関数のブートストラップにより複数ステップ先読みを可能にする $T^{h-1}v$ に関する1ステップグリーディ方策として $h$-グリーディ方策を提案する。
  • 修正されたベルマン演算子 $T_\kappa^\pi v = (I - \kappa\gamma P^\pi)^{-1}(r^\pi + (1-\kappa)\gamma P^\pi v)$ を用いて $\kappa$-グリーディ方策を導入し、1ステップと $h$-ステップ方策の間を補間する。
  • 近似がなくとも、ステップサイズが不十分なために、複数ステップグリーディ方策におけるソフト更新で単調な改善が失敗することを分析する。
  • 生成モデルまたは近似方策へのアクセスが可能である場合に、$\kappa$-グリーディ演算子を用いたオンラインおよび近似方策反復アルゴリズムを開発し、収束保証を付与する。
  • 成分ごとのバウンドと幾何級数を用いた誤差伝搬解析により、$\delta$、$\gamma$、および $\kappa$ の観点から性能バウンドを導出する。
  • 方策更新ダイナミクスをモデル化するための演算子 $D_\kappa^{\pi^*}P^{\pi^*}$ を用い、行列ノルムおよび級数和の技法を適用して反復回数にわたる累積誤差をバウンドする。

実験結果

リサーチクエスチョン

  • RQ1なぜ複数ステップグリーディ方策を用いる場合、正確な状況下でもソフト方策更新が単調な改善を保証しないのか?
  • RQ2複数ステップグリーディ方策を用いたオンラインおよび近似強化学習アルゴリズムは、依然として収束性と性能保証を達成できるか?
  • RQ3複数ステップグリーディ方策の性能バウンドは、近似誤差 $\delta$、割引因子 $\gamma$、および $\kappa$ パrameter にどのように依存するか?
  • RQ4更新ステップサイズは、近似設定における複数ステップグリーディ方策反復の収束にどのような影響を及けるか?
  • RQ5$h$-および $\kappa$-グリーディ方策は、ソフト更新の下で理論的安定性および収束性においてどのように比較できるか?

主な発見

  • 本稿は、ステップサイズが十分に大きくない限り、複数ステップグリーディ方策におけるソフト方策更新が単調な改善を保証しないことを証明している。これは1ステップグリーディの場合とは顕著な違いである。
  • $\kappa$-グリーディ演算子に関して、値関数推定における累積誤差の性能バウンド $\frac{1-\kappa\gamma}{1-\gamma} C^{\pi^*}_{\kappa}(\mu,\nu) \delta$ を確立している。
  • 生成モデルを仮定するオンライン設定では、アルゴリズムが $\frac{1-\kappa\gamma}{1-\gamma} C^{\pi^*}_{\kappa}(\mu,\nu) \delta + \xi^k \frac{R_{\max}}{1-\gamma}$ のバウンドを達成する。ここで $\xi < 1$ である。
  • 2番目のバウンド形式を用いることで、残差誤差を $\delta$ 未満にするために $k^* = \left\lceil \frac{(1-\kappa\gamma)\log(R_{\max}/(\delta(1-\gamma)))}{1-\gamma} \right\rceil$ を設定できる。
  • 本稿は、$\kappa$-グリーディ方策が、報酬形状化 $r^\pi + (1-\kappa)\gamma P^\pi v$ を施した $\kappa\gamma$-割引MDPを解くことに等価であることを示しており、原理的解釈を提供する。
  • 分析により、$\kappa$-グリーディ方策が1ステップと $h$-ステップ方策の間を連続的に補間し、計算コストと先読み深度の間の連続的トレードオフを提供することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。