Skip to main content
QUICK REVIEW

[論文レビュー] How to Learn a Useful Critic? Model-based Action-Gradient-Estimator Policy Optimization

Pierluca D’Oro, Wojciech Jaśkowski|arXiv (Cornell University)|Apr 29, 2020
Reinforcement Learning in Robotics参考文献 57被引用数 11
ひとこと要約

この論文では、学習済みのダイナミクスモデルを用いて時間差学習による時間差学習を実行することで、正確なアクション価値勾配を予測するように明示的に訓練する批判者を学習する、モデルベースのアクタ・クリティック強化学習アルゴリズムMAGEを提案する。ダイナミクスモデルを介した2階微分を活用することで、MAGEはMuJoCoの連続制御ベンチマークにおいて、最先端のモデルフリーおよびモデルベースのベースラインと比較して、より高いサンプル効率でポリシー最適化を改善する。

ABSTRACT

Deterministic-policy actor-critic algorithms for continuous control improve the actor by plugging its actions into the critic and ascending the action-value gradient, which is obtained by chaining the actor's Jacobian matrix with the gradient of the critic with respect to input actions. However, instead of gradients, the critic is, typically, only trained to accurately predict expected returns, which, on their own, are useless for policy optimization. In this paper, we propose MAGE, a model-based actor-critic algorithm, grounded in the theory of policy gradients, which explicitly learns the action-value gradient. MAGE backpropagates through the learned dynamics to compute gradient targets in temporal difference learning, leading to a critic tailored for policy improvement. On a set of MuJoCo continuous-control tasks, we demonstrate the efficiency of the algorithm in comparison to model-free and model-based state-of-the-art baselines.

研究の動機と目的

  • 決定的ポリシー勾配法に不可欠なアクション勾配の正確さではなく、価値予測の最適化を行う従来の批判者の限界を是正すること。
  • ポリシー改善のための正確な勾配を提供するように批判者を訓練することで、連続制御におけるサンプル効率を向上させること。
  • 報酬予測のみを目的とせず、ポリシー最適化に使用される勾配信号に直接的に批判者を最適化するモデルベース手法を開発すること。
  • 明示的なアクション勾配の学習が、高次元制御タスクにおけるより良いポリシー性能とより速い収束をもたらすことを実証すること。

提案手法

  • MAGEは、合成遷移を生成するために学習済みのダイナミクスモデルを使用し、モデルを介した逆伝播を可能にすることで、批判者のターゲット勾配を計算する。
  • 批判者は時間差学習を用いて訓練され、予測されたアクション価値勾配とターゲット勾配の誤差を最小化する。2重逆伝播を用いて勾配ターゲットを計算する。
  • 勾配ターゲットは、ダイナミクスモデルの微分可能性を活用して、TDターゲットをアクションに関して微分することで導出される。
  • アクターのヤコビアンと批判者のアクション勾配を連結することでポリシー勾配を計算し、批判者訓練とポリシー改善の整合性を保証する。
  • 勾配ターゲットのロバストネスと一般化性を向上させるために、ダイナミクスモデルのアンサンブルが使用される。
  • 価値と勾配予測誤差の両方を含む損失関数を用いて批判者を訓練し、モデルの微分可能なダイナミクスから導出される勾配の監視信号を用いる。

実験結果

リサーチクエスチョン

  • RQ1価値予測ではなく、アクション価値勾配の正確さを明示的に訓練する批判者を学習することで、より良いポリシー最適化が達成できるか?
  • RQ2学習済みのダイナミクスモデルを用いて勾配ターゲットを生成することで、モデルベース強化学習におけるサンプル効率が向上するか?
  • RQ3明示的なアクション勾配学習は、標準的な価値予測訓練と比較して、ポリシー性能と収束速度の面で優れているか?
  • RQ4ダイナミクスモデルを介した2階微分によって、標準的なモデルフリーまたはモデルベース手法と比較して、より効果的なポリシー勾配が得られるか?

主な発見

  • MAGEは、MuJoCoの連続制御環境において、最先端のモデルフリーおよびモデルベースのベースラインと比較して、顕著に高いサンプル効率を達成する。
  • 批判者が正確なアクション勾配を推定できるため、アルゴリズムはより速く収束し、より高い最終的性能を達成する。
  • アクション勾配の明示的訓練は、価値のみの訓練と比較して、より安定的かつ効果的なポリシー更新をもたらす。
  • 2重逆伝播を用いたモデルベースの勾配ターゲットの使用は、近似ダイナミクスモデルでさえも、優れたポリシー最適化を実現する。
  • 2階勾配のための学習時間の2倍の増加にもかかわらず、MAGEのサンプル効率のおかげで、相互作用にコストがかかる環境においてより適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。