Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Approximate Policy Iteration

Botao Hao, Nevena Lazic|arXiv (Cornell University)|Feb 8, 2020
Reinforcement Learning in Robotics参考文献 50被引用数 8
ひとこと要約

本論文は、データに依存する学習率と価値関数変化の楽観的予測を用いるモデルフリー強化学習アルゴリズムである適応的近似方策反復(AAPI)を提案する。この手法は、関数近似を伴う割引率なしで継続的なマルコフ決定過程において、$ otimes ilde{O}(T^{2/3})$ のレグレットバウンドを達成する。これは、以前の最良のバウンド$ otimes ilde{O}(T^{3/4})$ よりも向上したものである。本手法は、価値関数を損失とみなしてオンライン学習の技術を活用し、KL発散度による正則化を用いて方策更新の安定性を確保する。

ABSTRACT

Model-free reinforcement learning algorithms combined with value function approximation have recently achieved impressive performance in a variety of application domains. However, the theoretical understanding of such algorithms is limited, and existing results are largely focused on episodic or discounted Markov decision processes (MDPs). In this work, we present adaptive approximate policy iteration (AAPI), a learning scheme which enjoys a $ ilde{O}(T^{2/3})$ regret bound for undiscounted, continuing learning in uniformly ergodic MDPs. This is an improvement over the best existing bound of $ ilde{O}(T^{3/4})$ for the average-reward case with function approximation. Our algorithm and analysis rely on online learning techniques, where value functions are treated as losses. The main technical novelty is the use of a data-dependent adaptive learning rate coupled with a so-called optimistic prediction of upcoming losses. In addition to theoretical guarantees, we demonstrate the advantages of our approach empirically on several environments.

研究の動機と目的

  • 関数近似を伴う割引率なしで継続的なMDPにおけるモデルフリー強化学習の理論的ギャップを埋めること。
  • 関数近似を伴う平均報酬設定において、既存の$ otimes ilde{O}(T^{3/4})$ レグレットバウンドを改善すること。
  • オンライン学習と適応的正則化を活用する、安定的かつスケーラブルな方策反復フレームワークを開発すること。
  • 価値関数の平均化と適応的学習率の使用が方策改善において理論的に正当化されることを示すこと。

提案手法

  • アルゴリズムは、各状態における価値関数を損失とみなして、方策改善をオンライン学習問題として定式化する。
  • 状態に依存する、データに適応する学習率を用いた、適応的楽観的フォローザレギュラー化リーダー(AO-FTRL)更新則を採用する。
  • 方策は、過去のQ関数推定値の累積和に加え、次の損失の楽観的予測をとったボルツマン分布として構築される。
  • 前回の方策とのKL発散度による正則化を用いることで、安定性を確保し、大きな方策更新を防ぐ。
  • 本手法は特定の関数近似手法に依存せず、線形関数近似器やその他の表現にも適用可能である。
  • 理論的分析は、$ otimes\ell_\infty$-ノルムにおけるQ関数推定誤差のバウンドと、一様エルゴディック性などのMDPの性質の活用に依存する。

実験結果

リサーチクエスチョン

  • RQ1関数近似を伴う平均報酬設定、継続的MDPにおいて、$ otimes\widetilde{O}(T^{3/4})$ よりもタイトなレグレットバウンドを達成できるか?
  • RQ2適応的学習率と楽観的予測は、近似方策反復の収束性と安定性をどのように向上させるか?
  • RQ3価値関数推定値の変化が遅いという性質を活用することで、オンライン学習ベースのRLにおけるレグレットバウンドを改善できるか?
  • RQ4KL発散度による適応的正則化は、関数近似設定における方策更新の安定化にどのような役割を果たすか?
  • RQ5特徴表現と推定誤差に関するどのような仮定のもとで、$ otimes\widetilde{O}(T^{2/3})$ のレグレットバウンドを保証できるか?

主な発見

  • AAPIは、関数近似を伴う一様エルゴディックな割引率なしMDPにおいて、$ otimes\widetilde{O}(T^{2/3})$ のレグレットバウンドを達成し、以前の最良バウンド$ otimes\widetilde{O}(T^{3/4})$ よりも向上する。
  • この向上は、推定Q関数の変化が遅いという性質を活用し、方策更新における適応的かつデータ依存の学習率を用いることによる。
  • 理論的分析により、特徴行列の正則性と推定誤差に関する標準的仮定のもとで、価値関数の$ otimes\ell_\infty$-ノルム推定誤差が有界であることが示された。
  • 本手法は関数近似に対してロバストである。特定の関数クラスに依存せず、線形関数近似器を用いても適用可能である。
  • 実験結果は、特にサンプル効率と安定性の面で、既存手法よりもAAPIの実用的利点を示している。
  • 分析は、混合時間や定常分布といったMDP固有の性質を組み込んだ、新しいレグレット分解に依存している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。