Skip to main content
QUICK REVIEW

[論文レビュー] Monte Carlo Augmented Actor-Critic for Sparse Reward Deep Reinforcement Learning from Suboptimal Demonstrations

Albert Wilcox, Ashwin Balakrishna|arXiv (Cornell University)|Oct 14, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿では、モンテカルロ補正アクタクリティック(MCAC)を提案する。これは、アクタクリティック強化学習におけるパラメータフリーな拡張手法であり、報酬がスパarsな環境におけるサンプル効率を向上させる。具体的には、初期報酬バッファを劣化したデモで初期化し、標準的な時系列差分(TD)ターゲットとモンテカルロの報酬到着(reward-to-go)推定値の最大値として修正されたQ値を計算することで実現する。MCACは、5つの連続制御タスクにおける6つの標準的および模倣学習拡張RLアルゴリズムにおいて、学習を顕著に加速させ、ベースライン手法が失敗する状況でも信頼性のあるタスク完了を可能にする。

ABSTRACT

Providing densely shaped reward functions for RL algorithms is often exceedingly challenging, motivating the development of RL algorithms that can learn from easier-to-specify sparse reward functions. This sparsity poses new exploration challenges. One common way to address this problem is using demonstrations to provide initial signal about regions of the state space with high rewards. However, prior RL from demonstrations algorithms introduce significant complexity and many hyperparameters, making them hard to implement and tune. We introduce Monte Carlo Augmented Actor Critic (MCAC), a parameter free modification to standard actor-critic algorithms which initializes the replay buffer with demonstrations and computes a modified $Q$-value by taking the maximum of the standard temporal distance (TD) target and a Monte Carlo estimate of the reward-to-go. This encourages exploration in the neighborhood of high-performing trajectories by encouraging high $Q$-values in corresponding regions of the state space. Experiments across $5$ continuous control domains suggest that MCAC can be used to significantly increase learning efficiency across $6$ commonly used RL and RL-from-demonstrations algorithms. See https://sites.google.com/view/mcac-rl for code and supplementary material.

研究の動機と目的

  • 報酬関数がスパースな深層強化学習におけるサンプル非効率性の課題に対処すること。
  • 複雑なアルゴリズム的要素を導入せずに、報酬がスパースな連続制御タスクにおける探索および学習効率を向上させること。
  • 追加のハイパーパramータを必要とせず、既存のアクタクリティックアルゴリズムを簡単に強化できる、シンプルで即挿入可能な手法を開発すること。
  • 報酬がスパースな状況において、標準的RLおよび模倣学習拡張アルゴリズムの両方で、収束速度の向上と性能の向上を実現すること。

提案手法

  • 報酬バッファを劣化したエキスパートデモの集合で初期化し、初期のポリシーおよび価値関数信号を提供する。
  • クライアントの更新中に、標準的な時系列差分(TD)ターゲットと報酬到着のモンテカルロ推定値の最大値を取ることで、Q値ターゲットを修正する。
  • 成功した軌道からの長期的な密な報酬を、初期状態にまで効果的に伝播させるためにモンテカルロ推定値を活用し、価値の過小評価を低減する。
  • SAC、TD3、GQEといった標準的アクタクリティックアルゴリズムに加え、OEFD、CQL、AWACといった模倣学習アルゴリズムに対しても、修正されたQターゲットを適用する。
  • 追加の損失項、ハイパーパramータ、アーキテクチャの変更を避けることで、パラメータフリーを保証する。
  • 初期学習段階において、高性能な軌道の近傍における楽観的性を活用し、探索を促進するとともに、時間経過とともに改善を可能にする。

実験結果

リサーチクエスチョン

  • RQ1Q値ターゲットに対するシンプルでハイパーパラメータフリーの修正が、報酬がスパースな深層強化学習におけるサンプル効率を向上させ得るか?
  • RQ2MCACは、報酬がスパースな環境においてSAC や TD3 といった標準的アクタクリティックアルゴリズムに適用された場合、どのように性能を示すか?
  • RQ3MCACは、CQL、AWAC、OEFD といった模倣学習アルゴリズムが報酬がスパースな状況で、どの程度性能を向上させるか?
  • RQ4ベースライン手法が性能の崩壊を示すオンラインファインチューニング段階において、MCACは学習を安定化させるか?
  • RQ5MCACは、特に報酬が密な環境において、どのような条件下で失敗または学習を妨げるか?

主な発見

  • MCACにより、SAC や TD3 は、ベースライン手法がMCACなしでは進展がないPointmass NavigationおよびBlock Liftingタスクで、タスク完了を達成する。
  • Sequential PushingおよびBlock Extractionタスクにおいて、MCACはOEFDおよびAWACの学習を加速させ、ベースラインバージョンが失敗する状況でも訓練を安定化させる。
  • CQLに対しては、Pointmass Navigation、Block Extraction、Sequential Pushingにおいて、MCACが信頼性のある学習を可能にした。元のCQLモデルはほとんど進展がなかった。
  • MCACは、テストされた5つの連続制御ドメインすべてで性能を向上させ、SAC、TD3、GQE、OEFD、CQL、AWACといった複数のアルゴリズムで一貫した向上を示した。
  • 報酬が密な環境では、MCACがQ値の過大評価を引き起こす可能性があるため、学習を妨げる場合がある。これは、MCACが主に報酬がスパースな状況で最も効果的であることを示唆している。
  • ベースラインアルゴリズムがすでに速く収束するタスクでは、MCACに性能への悪影響は認められず、安全性および適応性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。