Skip to main content
QUICK REVIEW

[論文レビュー] Learning Synthetic Environments for Reinforcement Learning with Evolution Strategies

Fábio Furlan Ferreira, Thomas Nierhoff|arXiv (Cornell University)|Jan 24, 2021
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿では、自然的進化戦略(NES)を用いた二段階最適化を用いて、強化学習(RL)のための合成環境(SEs)を代理環境として学習する手法を提案する。SE上でエージェントを訓練し、実環境での性能に基づいてSEパラメータをメタアップデートすることで、訓練ステップを最大60%削減しつつ、ハイパーパrameterに対してロバストで、Dueling DDQN や TD3 といった多様なエージェントへの転送性を維持する。

ABSTRACT

This work explores learning agent-agnostic synthetic environments (SEs) for Reinforcement Learning. SEs act as a proxy for target environments and allow agents to be trained more efficiently than when directly trained on the target environment. We formulate this as a bi-level optimization problem and represent an SE as a neural network. By using Natural Evolution Strategies and a population of SE parameter vectors, we train agents in the inner loop on evolving SEs while in the outer loop we use the performance on the target task as a score for meta-updating the SE population. We show empirically that our method is capable of learning SEs for two discrete-action-space tasks (CartPole-v0 and Acrobot-v1) that allow us to train agents more robustly and with up to 60% fewer steps. Not only do we show in experiments with 4000 evaluations that the SEs are robust against hyperparameter changes such as the learning rate, batch sizes and network sizes, we also show that SEs trained with DDQN agents transfer in limited ways to a discrete-action-space version of TD3 and very well to Dueling DDQN.

研究の動機と目的

  • エージェントに依存しない合成環境(SEs)を学習し、実際の強化学習(RL)環境の効率的な代理として用いる方法を開発すること。
  • 複雑な環境や報酬がスパarsな環境における非効率なRL訓練の課題を、SEを用いてポリシー学習を加速することで解決すること。
  • 学習率、バッチサイズ、ネットワークサイズなどのハイパーパrameterの変化に対しても、SEを用いてロバストで一般化可能な訓練を可能にすること。
  • SEが、SE学習時に使用されていない異なるRLアルゴリズムに対しても、性能転送がどの程度可能であるかを調査すること。
  • SEからエージェントが学習する内容を、状態と報酬分布の分析を通じて明らかにすること。

提案手法

  • SE学習問題を二段階最適化として定式化:内側のループでエージェントを合成環境で訓練し、外側のループで実環境での性能に基づいてSEパラメータを更新する。
  • SEをパラメータψで定義されたニューラルネットワークとして表現し、現在の状態sと行動aに基づいて状態遷移と報酬を生成する。
  • 二階微分の明示的計算を避けるために、SEパラメータベクトルの集団を用いた自然的進化戦略(NES)を用いてメタアップデートを実行する。
  • 外側の目的関数(実環境での性能)に対するSEパラメータの勾配を推定する集団ベースのES更新ルールを採用する。
  • 内側のループで標準的なRLアルゴリズム(例:DDQN、Dueling DDQN、TD3)を用いてエージェントを訓練し、エージェントに依存しないSEの訓練を可能にする。
  • 多様なハイパーパrameterとエージェントアーキテクチャの下で、実環境での訓練効率と性能を測定することで、SEの有効性を評価する。

実験結果

リサーチクエスチョン

  • RQ1進化戦略を用いた二段階最適化により、合成環境を効果的に学習し、RL訓練の効率を向上させることができるか?
  • RQ2学習率、バッチサイズ、ニューラルネットワークの幅といったエージェントのハイパーパrameterの変更に対して、学習された合成環境はどの程度ロバストか?
  • RQ3SEで訓練されたエージェントが、SE学習時に使用されていない新しいRLアルゴリズムに対しても、どの程度性能を転送できるか?
  • RQ4学習されたSEの状態分布と報酬分布はどのような特徴を示し、実環境と比較してどう異なるか?
  • RQ5エージェントはSEから意味のある表現を学習しているのか、それとも分布シフトや過学習によるものなのか?

主な発見

  • 提案手法により、CartPole-v0 および Acrobot-v1 を解くために必要な訓練ステップ数が、実環境での直接訓練に比べ最大60%削減された。
  • DDQNエージェントで訓練されたSEは、Dueling DDQNに良好に一般化され、強い性能転送が達成された。また、TD3の離散行動アダプテーションに対しても、限定的ではあるが測定可能な転送が見られた。
  • 4000回の評価において、学習率、バッチサイズ、ニューラルネットワークの幅の変化に対しても、学習されたSEはロバストであることが示された。
  • SEにおける状態分布と報酬分布は、実環境と比較して分布シフトを示しており、SEはより狭く集中した状態分布と、密度の高い報酬信号を生成している。
  • 可視化分析の結果、SEの応答はエージェントの行動よりも実環境のダイナミクスに近い傾向にあり、分布シフトの原因がSE自体にあることが示された。
  • 定性的な分析から、SEは「ガイドシステム」として機能しており、信号が強い状態を強調することで、エージェントがより効率的に学習できるようにしていることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。