Skip to main content
QUICK REVIEW

[論文レビュー] Off-policy Maximum Entropy Reinforcement Learning : Soft Actor-Critic with Advantage Weighted Mixture Policy(SAC-AWMP)

Zhimin Hou, Kuangen Zhang|arXiv (Cornell University)|Feb 7, 2020
Reinforcement Learning in Robotics参考文献 23被引用数 10
ひとこと要約

本稿では、SACの単一の確率的ガウス方策を、状態とアドバンテージ関数の表現に基づいて動的に重みを割り当てる優位性重み付き混合方策(AWMP)に置き換えることで、Soft Actor-Critic(SAC)を強化するオフポリシー最大エントロピー強化学習アルゴリズム、SAC-AWMPを提案する。AWMPは、非連続的で滑らかでない方策の近似を改善可能である。本手法は、SACおよびTD3と比較して、4つのMuJoCo連続制御タスクにおいて優れたサンプル効率、安定性、パフォーランスを達成しており、特に難易度の高い環境(Ant-v2)において顕著な改善を示している。

ABSTRACT

The optimal policy of a reinforcement learning problem is often discontinuous and non-smooth. I.e., for two states with similar representations, their optimal policies can be significantly different. In this case, representing the entire policy with a function approximator (FA) with shared parameters for all states maybe not desirable, as the generalization ability of parameters sharing makes representing discontinuous, non-smooth policies difficult. A common way to solve this problem, known as Mixture-of-Experts, is to represent the policy as the weighted sum of multiple components, where different components perform well on different parts of the state space. Following this idea and inspired by a recent work called advantage-weighted information maximization, we propose to learn for each state weights of these components, so that they entail the information of the state itself and also the preferred action learned so far for the state. The action preference is characterized via the advantage function. In this case, the weight of each component would only be large for certain groups of states whose representations are similar and preferred action representations are also similar. Therefore each component is easy to be represented. We call a policy parameterized in this way an Advantage Weighted Mixture Policy (AWMP) and apply this idea to improve soft-actor-critic (SAC), one of the most competitive continuous control algorithm. Experimental results demonstrate that SAC with AWMP clearly outperforms SAC in four commonly used continuous control tasks and achieve stable performance across different random seeds.

研究の動機と目的

  • 高次元連続制御における非連続的・滑らかでない最適方策を表現する際の、標準的関数近似の限界を解消すること。
  • エキスパートの混合アプローチを活用することで、オフポリシー最大エントロピー強化学習における方策の一般化能力と表現能力を向上させること。
  • 状態とアクションの好みに関する情報を基に、方策コンポonentの重みを動的に割り当てることで、方策の柔軟性と学習の安定性を向上させること。
  • SACとAWMPをシームレスに統合することで、ハイパーパrameterチューニングなしにベースラインのSACおよびTD3を上回ることを実証すること。

提案手法

  • 方策は複数の確率的ガウス方策コンポーネントの混合としてパラメータ化され、重みは学習された事前ネットワークによって決定される。
  • 事前ネットワークは現在の状態を入力とし、アドバンテージ重み付き情報最大化を用いて、方策コンポーネントの確率分布を出力する。
  • 重みは、現在の方策が誘導する状態-アクションペアとサンプルされた方策コンポーネント間の相互情報量を最大化することで最適化される。
  • 学習の安定化のため、滑らかさ係数を用いたターゲットネットワークが使用され、ゲーティング方策は最近のポリシーからの準オフポリシー・データを用いて更新される。
  • 本手法はオフポリシー手法と互換性があり、SACの最大エントロピー目的および自動エントロピー調整と自然に統合可能である。
  • 方策コンポーネントの数はハイパーパrameterであり、実験的分析により、タスク全体で4つのコンポーネントで最適なパフォーマンスが得られると判明した。

実験結果

リサーチクエスチョン

  • RQ1動的に重み付けされたコンポーネントを有する混合方策は、連続制御における非連続的・滑らかでない最適方策の表現を改善できるか?
  • RQ2優位性重み付き情報最大化は、オフポリシー強化学習における方策コンポーネント選択の一般化能力と安定性をどのように向上させるか?
  • RQ3SACにAWMPを組み込むことで、多様なMuJoCo環境において、SACおよびTD3と比較してより優れたサンプル効率と訓練安定性が達成されるか?
  • RQ4方策コンポーネントの数を変化させた場合、学習パフォーマンスと収束性にどのような影響が生じるか?
  • RQ5ターゲットネットワークにおける滑らかさ係数の選択は、訓練安定性と学習速度にどのように影響するか?

主な発見

  • SAC-AWMPは、4つのMuJoCo連続制御タスクすべてにおいて、標準的SACおよびTD3よりも学習効率と安定性に優れており、特に挑戦的なAnt-v2環境で顕著な改善を示している。
  • Ant-v2では、SACおよびTD3と比較して、SAC-AWMPが顕著に高い報酬を達成しており、複雑で高次元の制御タスクをより効果的に解ける能力を示している。
  • 異なるランダムシードにおいても、低分散の安定した学習曲線を示しており、初期化や探索ノイズに対するロバストネスを示している。
  • 4つの方策コンポーネントを使用した場合が最良のパフォーマンスを示し、8つのコンポーネントでも低分散が維持されており、能力を拡張してもスケーラビリティと安定性が保証されている。
  • ハイパーパrameterチューニングなしに優れたパフォーマンスを維持しており、実用性と導入の容易さを示している。
  • 感度解析の結果、小さな滑らかさ係数(τQ = 0.001)が安定性を確保する一方、大きな値(τQ = 0.1)は不安定化や発散を引き起こすことが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。