Skip to main content
QUICK REVIEW

[論文レビュー] Remember and Forget for Experience Replay

Guido Novati, Petros Koumoutsakos|arXiv (Cornell University)|Jul 16, 2018
Reinforcement Learning in Robotics参考文献 40被引用数 14
ひとこと要約

本論文は、現在の方策とあまりに異なる経験をフィルタリングし、KLダイバージェンス制約による方策更新速度の制御を通じて、オフポリシー深層強化学習の安定性と性能を向上させる、新しい経験リプレイ手法であるRemember and Forget Experience Replay (ReF-ER)を提案する。ReF-ERは、連続的制御ベンチマークおよび部分的に観測可能な流体力学的タスクにおいて、DDPG、NAF、オフポリシーPG手法の各々で安定性と性能を向上させるが、顕著なハイパーパrameterチューニングを必要としない。

ABSTRACT

Experience replay (ER) is a fundamental component of off-policy deep reinforcement learning (RL). ER recalls experiences from past iterations to compute gradient estimates for the current policy, increasing data-efficiency. However, the accuracy of such updates may deteriorate when the policy diverges from past behaviors and can undermine the performance of ER. Many algorithms mitigate this issue by tuning hyper-parameters to slow down policy changes. An alternative is to actively enforce the similarity between policy and the experiences in the replay memory. We introduce Remember and Forget Experience Replay (ReF-ER), a novel method that can enhance RL algorithms with parameterized policies. ReF-ER (1) skips gradients computed from experiences that are too unlikely with the current policy and (2) regulates policy changes within a trust region of the replayed behaviors. We couple ReF-ER with Q-learning, deterministic policy gradient and off-policy gradient methods. We find that ReF-ER consistently improves the performance of continuous-action, off-policy RL on fully observable benchmarks and partially observable flow control problems.

研究の動機と目的

  • 経験リプレイ内の過去の経験と方策の行動が大きく逸脱した場合に生じるオフポリシー深層強化学習の不安定性および性能低下を是正すること。
  • 勾配更新にのみ『近似方策』の経験を効率的に使用することで、分散を低減し、データ効率を向上させること。
  • KLダイバージェンスに基づく信頼領域制約を用いて、再現された行動と方策の類似性を維持すること。
  • 顕著なハイパーパrameterチューニングを要せず、さまざまなオフポリシー学習アルゴリズム(DDPG、NAF、オフ-PG)においても安定した性能を発揮できること。
  • 標準的なGym環境および複雑で部分的に観測可能な流体力学的シミュレーションの両方において、有効性を示すこと。

提案手法

  • 重要度重み比 ρ = π^w(a|s)/μ(a|s) を用いて、経験を「近似方策」または「遠方策」と分類する。ここで ρ は方策の乖離度を測る。
  • 事前に定義されたしきい値内にある ρ の経験(すなわち「近似方策」経験)からのみ勾配更新を実行することで、古くまたは逸脱した行動からの誤った更新を回避する。
  • D_KL(μ || π^w) を最小化する信頼領域ペナルティを導入し、再現された行動からの方策の急激な逸脱を制御する。
  • 訓練の進行に伴い、ρ のしきい値および信頼領域ペナルティを段階的に減少させることで、オンポリシーに近い更新の精度を徐々に高める。
  • Q学習(NAF)、決定的方策勾配(DDPG)、オフポリシー方策勾配(オフ-PG)アルゴリズムとスムーズに統合可能である。
  • 非マルコフ的ダイナミクスを扱うために、部分的に観測可能な環境ではLSTMベースの関数近似器を採用する。

実験結果

リサーチクエスチョン

  • RQ1遠方策の経験を除外することで、オフポリシー深層RLアルゴリズムの安定性と性能が向上するか?
  • RQ2KLダイバージェンス制約による方策更新速度の制御が、学習効率とデータ利用効率を向上させるか?
  • RQ3ReF-ERは、タスク固有のハイパーパrameterチューニングを要せず、さまざまなオフポリシー学習アルゴリズムで性能向上を達成できるか?
  • RQ4複雑なダイナミクスを示す、例えば流体流れ制御のような部分的に観測可能な環境において、ReF-ERはどのように性能を発揮するか?
  • RQ5高精度な物理シミュレーションにおいて、ReF-ERは収束速度の向上とより優れた最終的性能を実現できるか?

主な発見

  • ReF-ERは、完全に観測可能なOpenAI Gymベンチマークにおいて、DDPG、NAF、オフポリシーPG手法のすべてで一貫した性能向上を達成した。
  • 部分的に観測可能な2次元流れ制御タスクにおいて、ReF-ERを搭載したDDPGは、標準的なERや他の手法よりも、最小限の制御コストで位置を維持する学習をより迅速に達成した。
  • 流体力学的制御において、ReF-ERを搭載したV-RACERは、ACERや標準的なDDPGを上回る最良の最終的性能を達成した。
  • 本手法は訓練の分散を低減し、顕著なハイパーパrameter最適化なしに信頼性のある学習を可能にした。
  • ReF-ERの信頼領域部は、方策の乖離を効果的に制限し、時間の経過とともに勾配推定の正確性を向上させた。
  • ReF-ERは、非マルコフ的環境におけるLSTMベースの関数近似器との統合を可能にし、複雑な制御タスクをサポートした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。