Skip to main content
QUICK REVIEW

[論文レビュー] Attraction-Repulsion Actor-Critic for Continuous Control Reinforcement Learning

Thang Doan, Bogdan Mazoure|arXiv (Cornell University)|Sep 17, 2019
Reinforcement Learning in Robotics参考文献 30被引用数 8
ひとこと要約

本稿では、正規化フローを用いてポリシー間のペairワイズな吸引・反発を実現する、構造的探索を可能にする人口ベースの強化学習手法であるAttraction-Repulsion Actor-Critic (ARAC)を提案する。KLダイバージェンスをNFパrameter化されたポリシー上で用いることで、ARACはMuJoCoベンチマークにおいて優れたサンプル効率と性能を達成し、とくに偽の最適解に陥りやすい高次元の二足歩行環境において、SACや他のベースラインを上回る性能を発揮する。

ABSTRACT

Continuous control tasks in reinforcement learning are important because they provide an important framework for learning in high-dimensional state spaces with deceptive rewards, where the agent can easily become trapped into suboptimal solutions. One way to avoid local optima is to use a population of agents to ensure coverage of the policy space, yet learning a population with the "best" coverage is still an open problem. In this work, we present a novel approach to population-based RL in continuous control that leverages properties of normalizing flows to perform attractive and repulsive operations between current members of the population and previously observed policies. Empirical results on the MuJoCo suite demonstrate a high performance gain for our algorithm compared to prior work, including Soft-Actor Critic (SAC).

研究の動機と目的

  • 高次元でマルチモーダルな報酬ランドスケープにおけるローカル最適解の問題に対処すること。
  • 報酬が密度な環境(例:MuJoCo)における探索を改善すること。標準的なアルゴリズムは、だましのダイナミクスにより部分最適なポリシーに収束する可能性がある。
  • パrameter空間ではなくポリシー空間における吸引・反発を用いて、人口ベースの探索を強化することにより多様性を促進すること。
  • より表現力が高く安定したポリシー表現を実現するため、正規化フローを活用し、有効なKLベースのダイバージェンス計算を可能とすること。
  • ARACが複雑な歩行タスクにおいて、単一エージェントおよび従来の人口ベース手法よりも高速な収束と高いパフォーマンスを達成できることを示すこと。

提案手法

  • 本手法は、正規化フロー(NF)でパラメータ化されたポリシーを持つエージェントの集合を採用し、柔軟で非ガウス型のポリシー分布と、計算可能な密度推定を可能にする。
  • 吸引・反発(AR)損失を導入し、ポリシー間のKLダイバージェンスを用いて多様性を促進:類似したポリシー同士を反発させ、高いパフォーマンスを示した先祖に引き寄せること。
  • AR目的関数を、Soft Actor-Critic(SAC)フレームワークに統合し、反発力の強さを制御するハイパーパrameter λ を導入する。
  • 二モーダルなアーカイブが、高いパフォーマンスで多様なポリシーを保存し、先祖をサンプリングして吸引を誘導することで、長期的なポリシー網羅性を確保する。
  • NFポリシー間のKLダイバージェンスを計算することで、分散の崩壊やガウス型ポリシーで見られる平均のダイバージェンスを回避する安定で表現力のある反発が可能になる。
  • 全体の損失関数は、SACの標準的損失とAR損失を組み合わせており、パフォーマンスと多様性の両方を同時に最適化可能である。

実験結果

リサーチクエスチョン

  • RQ1ポリシー空間における吸引・反発メカニズムは、連続制御RLにおける探索と一般化を改善できるか?
  • RQ2ガウス型ポリシーではなく正規化フローを用いることで、より安定的かつ効果的な吸引・反発ダイナミクスが得られるか?
  • RQ3ARACは、MuJoCoの歩行タスクにおいて、SACや他の人口ベース手法と比較して、サンプル効率と最終パフォーマンスで優れているか?
  • RQ4標準的なアルゴリズムが失敗するスパarsely報酬環境でも、ARACは適切に学習できるか?
  • RQ5ARメカニズムは、アクション空間のカバー範囲を拡大し、ねじれたり重複するポリシーの発生を回避できるか?

主な発見

  • ARACは、すべてのMuJoCo連続制御タスクでSoft Actor-Critic(SAC)や他のベースラインを上回り、より高い最終パフォーマンスと高速な収束を達成した。
  • Ant-v2およびHumanoid-v2環境では、ARACはそれぞれ100万ステップで6,000および4,000の累積報酬に到達したが、単一のSACエージェントは400万ステップと300万ステップを要した。
  • スパース報酬環境であるSparseHumanoid-v2では、ARACが唯一非ゼロのパフォーマンスを達成し、報酬がスパースな状況でも頑健であることを示した。
  • アブレーションスタディの結果、反発がない(λ=0)とエージェントの行動がアクション空間でねじれてしまう一方、λ>0の場合は異なる領域を探索し、多様性の効果的強化が確認された。
  • ガウス型ポリシーではなくNFポリシーを用いることで、反発下でも分散の崩壊や平均のダイバージェンスが回避され、より安定的かつ効果的な探索が可能になった。
  • t-SNE可視化により、NFポリシーにおける反発力がエージェント間のアクション分布の分離を促進していることが確認された。これに対してガウス型ポリシーでは多様性を維持できず、失敗している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。