Skip to main content
QUICK REVIEW

[論文レビュー] Deep Black-Box Reinforcement Learning with Movement Primitives

Fabian Otto, Onur Çelik|arXiv (Cornell University)|Oct 18, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本論文は、微分可能信頼領域射影層(TRPL)を用いた深層エピソードベース強化学習(ERL)アルゴリズムを提案し、動きのプリミティブに対する高次元で正確なポリシー更新を可能にする。スパースかつ非マルコフ的報酬設定において、ステップベース手法よりも優れた性能を示し、特にジャンプ、ボール投げ、テーブルテニスといった複雑なロボット制御タスクにおいて、より高品質で滑らかでエネルギー効率の良いポリシーを達成する。

ABSTRACT

\Episode-based reinforcement learning (ERL) algorithms treat reinforcement learning (RL) as a black-box optimization problem where we learn to select a parameter vector of a controller, often represented as a movement primitive, for a given task descriptor called a context. ERL offers several distinct benefits in comparison to step-based RL. It generates smooth control trajectories, can handle non-Markovian reward definitions, and the resulting exploration in parameter space is well suited for solving sparse reward settings. Yet, the high dimensionality of the movement primitive parameters has so far hampered the effective use of deep RL methods. In this paper, we present a new algorithm for deep ERL. It is based on differentiable trust region layers, a successful on-policy deep RL algorithm. These layers allow us to specify trust regions for the policy update that are solved exactly for each state using convex optimization, which enables policies learning with the high precision required for the ERL. We compare our ERL algorithm to state-of-the-art step-based algorithms in many complex simulated robotic control tasks. In doing so, we investigate different reward formulations - dense, sparse, and non-Markovian. While step-based algorithms perform well only on dense rewards, ERL performs favorably on sparse and non-Markovian rewards. Moreover, our results show that the sparse and the non-Markovian rewards are also often better suited to define the desired behavior, allowing us to obtain considerably higher quality policies compared to step-based RL.

研究の動機と目的

  • エピソードベースRLにおける高次元の動きのプリミティブパラメータへの深層RLの適用という課題に対処すること。
  • ステップベースRLが通常失敗する、スパースかつ非マルコフ的報酬設定において効果的な学習を可能にすること。
  • 高次元パrameter空間に適した、堅牢で正確なポリシー更新メカニズムの開発。
  • スパースかつ非マルコフ的報酬が、設計された密度の高い報酬よりも高品質なポリシーをもたらす可能性があることを示すこと。

提案手法

  • ポリシー更新時に正確な信頼領域を強制するために、微分可能な信頼領域射影層(TRPL)を用い、高次元のアクション空間における高い精度を確保する。
  • 文脈に応じたポリシーが動きのプリミティブパラメータを予測するブラックボックスRLフレームワークを採用する。
  • 滑らかで軌道ベースの制御ポリシーを生成するために、動きのプリミティブ(MPs)を採用する。
  • 各タイムステップで所望の状態を低レベルのアクションにマッピングする、軌道追従制御器を統合する。
  • MPパラメータ予測を、制御器パラメータ空間上のブラックボックス最適化問題として扱う。
  • TRPLによる凸最適化を活用し、PPOに類似した手法で一般的に生じる近似誤差を回避して信頼領域を正確に解く。

実験結果

リサーチクエスチョン

  • RQ1微分可能信頼領域を備えた深層ERLは、スパースかつ非マルコフ的報酬設定において、ステップベースRLを上回る性能を示せるか?
  • RQ2非マルコフ的かつスパースな報酬は、密度の高いマルコフ的報酬よりも高品質でエネルギー効率の良いポリシーをもたらすか?
  • RQ3TRPLは、高次元の動きのプリミティブパラメータ空間において、安定的かつ正確なポリシー更新を可能にするか?
  • RQ4提案手法は、密度の高い報酬では表現しにくい、複雑な現実世界のタスク仕様に対しても堅牢であるか?

主な発見

  • ホッパーのジャンプタスクにおいて、BBRL-TRPLは重心高さを約20 cmまで達成し、PPOよりも20%高い。また、ゴールの精度も向上した。
  • ビアポンタスクでは、動的リリースタイミングでのボール投げに成功したが、PPOは固定最適リリースでも失敗した。
  • テーブルテニスでは、BBRL-TRPLは60%以上のケースでボールをターゲット付近に返すことができたが、PPOおよびBBRL-PPOは十分な精度に達しなかった。
  • 本手法は非マルコフ的設定において一貫してPPOおよびTRPLを上回り、時間に依存する複雑な行動に対しても堅牢であることを示した。
  • スパースかつ非マルコフ的報酬は、密度の高い設計報酬よりもエネルギー効率が良く、より堅牢なポリシーをもたらした。
  • CMOREはボールを投げることは可能だったが、一部の文脈でのみ有効であり、BBRL-TRPLは全文脈空間にわたって一般化できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。