Skip to main content
QUICK REVIEW

[論文レビュー] Policy-Aware Model Learning for Policy Gradient Methods

Romina Abachi, Mohammad Ghavamzadeh|arXiv (Cornell University)|Feb 28, 2020
Reinforcement Learning in Robotics参考文献 73被引用数 7
ひとこと要約

本稿では、モデルベース強化学習における方策勾配プランナの特定のニーズに合わせてモデル学習を最適化する、Policy-Aware Model Learning (PAML) を導入する。プランナがモデルをどのように使用するかを組み込んだ損失関数を導出することで、従来の最尤推定とは異なり、サンプル効率と方策性能を向上させ、ベンチマーク環境においてより良い収束性と実験的結果を達成する。

ABSTRACT

This paper considers the problem of learning a model in model-based reinforcement learning (MBRL). We examine how the planning module of an MBRL algorithm uses the model, and propose that the model learning module should incorporate the way the planner is going to use the model. This is in contrast to conventional model learning approaches, such as those based on maximum likelihood estimate, that learn a predictive model of the environment without explicitly considering the interaction of the model and the planner. We focus on policy gradient type of planning algorithms and derive new loss functions for model learning that incorporate how the planner uses the model. We call this approach Policy-Aware Model Learning (PAML). We theoretically analyze a generic model-based policy gradient algorithm and provide a convergence guarantee for the optimized policy. We also empirically evaluate PAML on some benchmark problems, showing promising results.

研究の動機と目的

  • モデルベース強化学習における従来のモデル学習の非効率性に取り組む。これは、モデルの正確さそのものを目的としており、モデルが計画にどのように使用されるかを考慮しない。
  • 意思決定に影響しない環境的ダイナミクスに無駄なモデル容量が使われることを減らす。そのために、方策勾配推定に影響を与える要因に学習を集中させる。
  • 方策勾配に基づくMBRLにおけるサンプル複雑性と方策性能を向上させる理論的裏付けのある、方策に配慮したモデル学習フレームワークを開発する。
  • 提案されたモデルベース方策勾配アルゴリズムによる最適化方策の収束保証を提供する。

提案手法

  • 予測精度に依存するのではなく、方策勾配プランナとモデルの相互作用を明示的に組み込んだ新しい損失関数を提案する。
  • モデルの全変動距離(total variation distance)を用いて、方策勾配推定誤差の理論的上限を導出する。これにより、モデル誤差と方策性能の低下の関係を明確にする。
  • モデルが状態遷移予測の正確さだけでなく、正確な方策勾配推定を最適化するように学習される、モデルベース方策勾配アルゴリズムを設計する。
  • 計画用にハイブリッドデータ生成戦略を採用する。これは、リプレイバッファからの実際の遷移、環境の初期状態分布からのサンプリングされた初期状態、およびバッファ状態の周囲の摂動を組み合わせる。
  • 方策と価値関数のための別々のネットワークを備えた二重ストリームのアクタークリティックアーキテクチャを採用する。これは、ターゲットネットワークとソフト更新を用いたオフポリシーの深層強化学習(DDPGスタイル)で訓練される。
  • 学習率スケジューリングと各手法ごとのハイパーパramータチューニングを適用し、PAMLとMLEベースライン間の公平な比較を保証する。

実験結果

リサーチクエスチョン

  • RQ1計画に特化した目的をモデル学習に組み込むと、方策勾配推定の正確性と最終的な方策性能にどのような影響を与えるか?
  • RQ2予測誤差の最小化ではなく、方策勾配誤差の最小化を目的としたモデル学習は、モデルベース強化学習におけるより優れたサンプル効率をもたらすか?
  • RQ3方策勾配法における、モデル誤差(全変動距離で測定)とそれによる方策勾配推定誤差との理論的関係は何か?
  • RQ4PAMLは、半教師あり制御タスクのベンチマークにおいて、最尤推定(MLE)およびモデルフリーのベースラインと比較して、学習速度と最終的性能の両面でどのように異なるか?

主な発見

  • PAMLは、HalfCheetah、Ant、Hopperを含む複数の連続的制御ベンチマークで、最尤推定(MLE)ベースラインに比べて優れたサンプル効率と最終的な方策性能を達成する。
  • 特に高次元の状態空間と複雑なダイナミクスを有する環境では、学習速度と漸近的性能の両面で一貫した改善が見られる。
  • 実験結果から、PAMLは同じ数の実環境遷移を用いても、MLEおよびモデルフリーのDDPGベースラインよりも速く収束し、より高い報酬に到達することが示された。
  • 理論的分析により、方策勾配推定誤差が真の遷移ダイナミクスとモデルの遷移ダイナミクスの全変動距離によって上限付けられることを確立した。これにより、本手法の正当性が形式的に裏付けられた。
  • 不要な環境的ダイナミクスが存在する環境でもPAMLはMLEを上回ることから、意思決定に関連する側面にモデル容量を集中させることで学習が改善されることを確認した。
  • アブレーションスタディの結果、計画用に使用するデータ分布(リプレイバッファ、初期状態分布、ランダムな摂動)の選択が性能に顕著な影響を与えることが分かったが、PAMLはこの選択に対して頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。