Skip to main content
QUICK REVIEW

[論文レビュー] ERL-Re$^2$: Efficient Evolutionary Reinforcement Learning with Shared State Representation and Individual Policy Representation

Jianye Hao, Pengyi Li|arXiv (Cornell University)|Oct 26, 2022
Reinforcement Learning in Robotics被引用数 16
ひとこと要約

ERL-Re² は、共通の特徴学習のための共有非線形状態表現と、効率的で行動レベルの進化を可能にする個々の線形方策表現を用いる、二段階表現を通じて深層強化学習と進化計算を統合する画期的な進化型強化学習フレームワークを提案する。線形方策空間における新しい交叉および変異操作を用いた方策最適化と、Policy-extended Value Function Approximator (PeVFA) の統合により、サンプル効率性と収束性が向上した状態の連続制御タスクにおいて最先端の性能を達成する。

ABSTRACT

Deep Reinforcement Learning (Deep RL) and Evolutionary Algorithms (EA) are two major paradigms of policy optimization with distinct learning principles, i.e., gradient-based v.s. gradient-free. An appealing research direction is integrating Deep RL and EA to devise new methods by fusing their complementary advantages. However, existing works on combining Deep RL and EA have two common drawbacks: 1) the RL agent and EA agents learn their policies individually, neglecting efficient sharing of useful common knowledge; 2) parameter-level policy optimization guarantees no semantic level of behavior evolution for the EA side. In this paper, we propose Evolutionary Reinforcement Learning with Two-scale State Representation and Policy Representation (ERL-Re$^2$), a novel solution to the aforementioned two drawbacks. The key idea of ERL-Re$^2$ is two-scale representation: all EA and RL policies share the same nonlinear state representation while maintaining individual} linear policy representations. The state representation conveys expressive common features of the environment learned by all the agents collectively; the linear policy representation provides a favorable space for efficient policy optimization, where novel behavior-level crossover and mutation operations can be performed. Moreover, the linear policy representation allows convenient generalization of policy fitness with the help of the Policy-extended Value Function Approximator (PeVFA), further improving the sample efficiency of fitness estimation. The experiments on a range of continuous control tasks show that ERL-Re$^2$ consistently outperforms advanced baselines and achieves the State Of The Art (SOTA). Our code is available on https://github.com/yeshenpy/ERL-Re2.

研究の動機と目的

  • 個々のエージェントが孤立して状態表現を学習することに起因する方策学習の非効率性と冗長性を解消すること。
  • パラメータレベルの進化に限界がある進化計算の問題を克服し、意味的な行動進化が可能で、方策崩壊のリスクが低い状態を実現すること。
  • 共有表現を通じた価値関数一般化を可能にすることで、進化型強化学習におけるサンプル効率性を向上させること。
  • 非線形パラメータ空間ではなく線形方策表現空間で作業することで、効率的で行動レベルの進化を可能にすること。
  • 深層RLと進化計算を効果的に統合することで、連続制御ベンチマークで最先端の性能を達成すること。

提案手法

  • 二段階表現の導入:すべてのエージェントが共同で学習する共有非線形状態表現 $Z_{\phi}$ と、個々の線形方策表現 $W$。
  • すべてのエージェントにおける価値関数最大化に基づく統一された勾配方向を用いて、共有状態表現 $Z_{\phi}$ を最適化する。
  • 線形方策表現空間上で直接、交叉および変異操作を実行することで、意味的レベルの行動進化を可能にする。
  • 1ステップTD学習を用いたオフポリシー学習により、効率的なフィットネス推定を実現する、Policy-extended Value Function Approximator (PeVFA) $\mathbb{Q}_{\theta}(s,a,W)$ を提案する。
  • PeVFA を進化計算および深層強化学習エージェントの両方と統合し、方策間での価値推定の一般化を実現し、サンプル効率性を向上させる。
  • 方策集団における平均および共分散の更新に遺伝的演算子を置き換えることで、CEM などのさまざまな進化戦略との柔軟な統合を可能にする。

実験結果

リサーチクエスチョン

  • RQ1進化計算と強化学習エージェント間で共有される非線形状態表現が、特徴学習の効率性を向上させ、冗長性を低減できるか?
  • RQ2線形方策空間における行動レベルの進化が、パラメータレベルの進化と比較して、より安定的かつ効果的な方策最適化を実現できるか?
  • RQ3PeVFA のオフポリシー学習が、集団内の多様な方策において、効率的で一般化可能なフィットネス推定を可能にするか?
  • RQ4ERL-Re² における深層RLと進化計算の連携が、従来のSOTA手法と比較して、連続制御タスクで優れた性能を発揮するか?
  • RQ5二段階表現フレームワークが、複雑な制御環境において、サンプル効率性と収束速度をどの程度向上させるか?

主な発見

  • ERL-Re² は、MuJoCoベンチマークスイートのさまざまな連続制御タスクで最先端の性能を達成する。
  • 共有状態表現により、方策固有の表現の冗長性が排除され、特徴学習の効率性が顕著に向上する。
  • 線形方策表現により、効果的な行動レベルの交叉および変異が可能となり、パラメータレベルの進化で観察される方策崩壊のリスクが低減される。
  • オフポリシーでのPeVFA学習により、より少ないサンプルで効率的なフィットネス推定が可能となり、全体の学習効率が向上する。
  • Swimmer や Humanoid などの多様な環境において、ERL や他のハイブリッドRL-EA手法を上回る性能を示す。
  • 特に従来の進化手法が苦戦する高次元の行動空間においても、優れた一般化性能と安定性を示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。