Skip to main content
QUICK REVIEW

[論文レビュー] On the model-based stochastic value gradient for continuous reinforcement learning

Brandon Amos, Samuel Stanton|arXiv (Cornell University)|Aug 28, 2020
Reinforcement Learning in Robotics参考文献 78被引用数 16
ひとこと要約

本論文では、モデルフリーのソフトQ値推定とモデルベースの確率的価値勾配(SVG)を組み合わせた単純なモデルに基づく強化学習エージェントを提案する。単一の決定的ダイナミクスモデルとソフト価値推定のみを用いることで、高次元連続制御タスクにおいて最先端の性能を達成し、サンプル効率および最終的報酬の面で、モデルフリーおよび複雑なモデルベースのベースラインを上回った。

ABSTRACT

For over a decade, model-based reinforcement learning has been seen as a way to leverage control-based domain knowledge to improve the sample-efficiency of reinforcement learning agents. While model-based agents are conceptually appealing, their policies tend to lag behind those of model-free agents in terms of final reward, especially in non-trivial environments. In response, researchers have proposed model-based agents with increasingly complex components, from ensembles of probabilistic dynamics models, to heuristics for mitigating model error. In a reversal of this trend, we show that simple model-based agents can be derived from existing ideas that not only match, but outperform state-of-the-art model-free agents in terms of both sample-efficiency and final reward. We find that a model-free soft value estimate for policy evaluation and a model-based stochastic value gradient for policy improvement is an effective combination, achieving state-of-the-art results on a high-dimensional humanoid control task, which most model-based agents are unable to solve. Our findings suggest that model-based policy evaluation deserves closer attention.

研究の動機と目的

  • 現代のベンチマークタスクにおいて、最先端の性能を達成できる最も単純なモデルベースエージェントを特定すること。
  • 頑健な価値推定を組み合わせた場合に、モデルベースのポリシー改善がモデルフリー手法を上回るかどうかを調査すること。
  • ダイナミクスモデルの誤差に対して、価値学習とポリシー改善の感受性を評価すること。
  • モデルベース強化学習における複雑化の傾向に挑戦し、単純なコンポONENTが洗練されたアンサンブルを上回ることを示すこと。
  • 連続制御分野において、モデルベースのポリシー評価が再び注目されるべきであることを示すこと。

提案手法

  • 本手法は、ポリシー改善のための短いホライズンロールアウトを生成するために、単一の決定的ダイナミクスモデルを用いる。
  • SACからのソフトQ値推定を用いて、ポリシー評価のための安定的かつ正確な価値ターゲットを提供する。
  • エージェントのアクターは、モデルが生成するロールアウトを用いてSVGで更新され、同時にクライアントは実環境およびモデル生成遷移の両方で学習される。
  • 本手法は、モデルアンサンブルや広範なモデルファインチューニングといった複雑なコンポONENTを避けており、代わりにエントロピー正則化と価値ソフトニングによる安定性を確保する。
  • 価値拡張は、価値学習の際ではなく、ポリシー改善の際のみ適用され、モデル誤差への感受性を低減する。
  • 本手法は、挑戦的なヒューマノイド環境を含む高次元制御タスクで評価された。

実験結果

リサーチクエスチョン

  • RQ1単一の決定的ダイナミクスモデルを用いた単純なモデルベースエージェントが、最先端のモデルフリーおよび複雑なモデルベースエージェントを上回ることができるか?
  • RQ2モデル誤差は、モデルベース強化学習における価値学習とポリシー改善のどちらにより大きな影響を与えるか?
  • RQ3モデルフリーのSACからのソフト価値推定を用いることで、モデルベースのポリシー更新のロバスト性が向上するか?
  • RQ4MVE(モデルベース価値拡張)を導入することで、限られたデータでもモデルフリー手法を上回る最終的パフォーマンスを達成できるか?
  • RQ5性能向上はアーキテクチャ設計に起因するのか、それとも価値推定とポリシー勾配技術の特定の組み合わせに起因するのか?

主な発見

  • 提案されたSAC-SVG(H)エージェントは、高次元ヒューマノイド制御タスクにおいて、最先端のモデルフリーおよびモデルベースエージェントを上回り、より高い最終的報酬と優れたサンプル効率を達成した。
  • ハッパー環境では、単一の決定的ダイナミクスモデルを用いても、MBPOや他の複雑なモデルベースエージェントと同等またはそれ以上の性能を発揮した。
  • 価値学習は、クライアントの更新中にモデル誤差が蓄積されるため、ポリシー改善よりも顕著にモデル誤差に感受性が高かった。
  • 性能向上はモデルアーキテクチャそのものに起因するものではなく、同じモデルアーキテクチャでも異なる訓練設定では失敗したため、訓練手順の重要性が浮き彫りになった。
  • クライアントの更新にMVE(モデルベース価値拡張)を導入したところ、特に長ホライズン設定でモデル誤差が蓄積するため、時間経過とともに性能が低下した。
  • 結果から、価値学習とは適切に分離されたモデルベースのポリシー評価は、モデルベース強化学習における強力でロバストなコンポONENTである可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。