Skip to main content
QUICK REVIEW

[論文レビュー] Maximum Mutation Reinforcement Learning for Scalable Control

Karush Suri, Xiao Qi Shi|arXiv (Cornell University)|Jul 24, 2020
Reinforcement Learning in Robotics参考文献 41被引用数 9
ひとこと要約

本論文では、進化戦略(ES)による探索とソフトアクターキャリブレーター(SAC)による方策最適化を分離することで、スケーラブルな強化学習アルゴリズムである進化ベースのソフトアクターキャリブレーター(ESAC)を提案する。自動変異チューニング(AMT)とアンダンテクロスオーバーを統合することで、ESACはMuJoCoおよびDeepMind Control Suiteのタスクにおいて最先端の性能を達成し、1エピソードあたりのウォールクロック時間を60%低減するとともに、ハイパーパramータ感受性に対する耐性が向上し、サンプル効率およびスケーラビリティにおいてSACを上回った。

ABSTRACT

Advances in Reinforcement Learning (RL) have demonstrated data efficiency and optimal control over large state spaces at the cost of scalable performance. Genetic methods, on the other hand, provide scalability but depict hyperparameter sensitivity towards evolutionary operations. However, a combination of the two methods has recently demonstrated success in scaling RL agents to high-dimensional action spaces. Parallel to recent developments, we present the Evolution-based Soft Actor-Critic (ESAC), a scalable RL algorithm. We abstract exploration from exploitation by combining Evolution Strategies (ES) with Soft Actor-Critic (SAC). Through this lens, we enable dominant skill transfer between offsprings by making use of soft winner selections and genetic crossovers in hindsight and simultaneously improve hyperparameter sensitivity in evolutions using the novel Automatic Mutation Tuning (AMT). AMT gradually replaces the entropy framework of SAC allowing the population to succeed at the task while acting as randomly as possible, without making use of backpropagation updates. In a study of challenging locomotion tasks consisting of high-dimensional action spaces and sparse rewards, ESAC demonstrates improved performance and sample efficiency in comparison to the Maximum Entropy framework. Additionally, ESAC presents efficacious use of hardware resources and algorithm overhead. A complete implementation of ESAC can be found at karush17.github.io/esac-web/.

研究の動機と目的

  • 高次元アクション空間および長時間スケールタスクにおける深層強化学習(RL)アルゴリズムのスケーラビリティ制限に対処すること。
  • 変異率および集団ダイナミクスにおける進化戦略(ES)のハイパーパramータ感受性を克服すること。
  • バックプロパゲーションに依存せずに効率的なスケーラブルな探索を可能にするとともに、SACのサンプル効率および性能を維持すること。
  • ESにおけるソフトウィンターセレクションおよびアンダンテクロスオーバーを通じて、スキルの転送性および集団の耐性を向上させること。
  • SACにおける勾配更新の依存度を低下させることを目的とし、勾配更新の頻度を動的に減少させながら性能を維持すること。

提案手法

  • ESACは、ESによる探索(探索)とSACによる利 exploit(利 exploit)を分離し、ESを用いて方策重みを進化させ、SACを用いて勾配更新でそれを精錬する。
  • 自動変異チューニング(AMT)を導入し、クリッピング領域ζ内での変異率σを段階的に増加させることで、バックプロパゲーションを用いずに探索を強化する。
  • ソフトウィンターセレクションにより、上位のオフスプリングが繁殖に選ばれるが、依然として変異の対象となるため、停滞を防ぎ、スキルの転送を可能にする。
  • アンダンテクロスオーバーにより、評価後に優位な特徴がオフスプリング間で移動可能となり、遺伝的再結合を通じて集団レベルのパフォーマンスが向上する。
  • SACの勾配更新回数は時間とともに指数関数的に減少させ、計算オーバーヘッドを低減しながら学習進行を維持する。
  • アルゴリズムは、集団サイズや変異率を変化させたMuJoCoおよびDeepMind Control Suite環境で評価され、スケーラビリティおよび耐性を評価した。

実験結果

リサーチクエスチョン

  • RQ1ESとSACを統合したハイブリッドRL手法は、高次元制御タスクにおいて、高いサンプル効率とスケーラビリティを両立できるか?
  • RQ2バックプロパゲーションを用いずに、自動変異チューニング(AMT)は進化戦略におけるハイパーパramータ感受性をどのように改善するか?
  • RQ3アンダンテクロスオーバーおよびソフトウィンターセレクションは、ESベースのRLにおけるスキル転送性および集団パフォーマンスをどの程度向上できるか?
  • RQ4SACの勾配更新頻度を低下させることで、ESベースの探索と組み合わせた場合、パフォーマンスが劣化するか?
  • RQ5困難な歩行タスクにおいて、ESACはSACおよび標準的なESと比較して、ウォールクロック時間およびサンプル効率で優れているか?

主な発見

  • ESACは、15のMuJoCoおよびDeepMind Control Suiteタスクのうち10で最先端のパフォーマンスを達成し、さまざまなHumanoidバージョンを含む。
  • SACと比較して、平均的な1エピソードあたりのウォールクロック時間を約60%短縮し、CPUリソース上での強力なスケーラビリティを示した。
  • AMTにより、ζの狭い範囲(10⁻⁴〜10⁻²)で頑健なパフォーマンスが達成されたが、ζ ≥ 0.1では顕著な感受性が観察された。これはハイパーパramータの耐性向上を示している。
  • アンダンテクロスオーバーおよびソフトウィンターセレクションにより、上位エージェントを変異から保護しないまま、優位なスキルの転送が可能になり、集団レベルのパフォーマンスが向上した。
  • SACと比較して、ESACは顕著に少ないバックプロパゲーション更新回数で実行され、勾配ベース最適化への依存度が低減したが、サンプル効率は維持または向上した。
  • 異なる集団サイズおよび変異率でもパフォーマンスが維持されたことから、スケーラビリティおよび効率的なハードウェア利用が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。