Skip to main content
QUICK REVIEW

[論文レビュー] A Max-Min Entropy Framework for Reinforcement Learning

Seungyul Han, Youngchul Sung|arXiv (Cornell University)|Jun 19, 2021
Reinforcement Learning in Robotics参考文献 55被引用数 5
ひとこと要約

本論文は、低エントロピー状態を標的とし、それらのエントロピーを最大化することで探索を強化する、最大最小エントロピー(MME)フレームワークを提案する。これは標準的な最大エントロピー強化学習とは対照的であり、高エントロピー状態を好む。この手法は、分離型アクタークリティックアルゴリズムを用いて探索と報酬の最適化を分離し、スパース報酬および高次元制御タスクにおいて、SACや他の最先端手法を著しく上回る性能を達成する。

ABSTRACT

In this paper, we propose a max-min entropy framework for reinforcement learning (RL) to overcome the limitation of the soft actor-critic (SAC) algorithm implementing the maximum entropy RL in model-free sample-based learning. Whereas the maximum entropy RL guides learning for policies to reach states with high entropy in the future, the proposed max-min entropy framework aims to learn to visit states with low entropy and maximize the entropy of these low-entropy states to promote better exploration. For general Markov decision processes (MDPs), an efficient algorithm is constructed under the proposed max-min entropy framework based on disentanglement of exploration and exploitation. Numerical results show that the proposed algorithm yields drastic performance improvement over the current state-of-the-art RL algorithms.

研究の動機と目的

  • 関数近似を伴うオフポリシーな強化学習における最大エントロピーRLの限界に対処する。特に、効果的な探索を妨げる正のフィードバックループを解消する。
  • 標準的な最大エントロピーRLが高エントロピー状態を好む傾向があることに対処し、探索の多様性が低下するのを防ぐ。
  • 低エントロピー状態のエントロピーを最大化することで、公平な探索を促進し、状態空間のカバレッジを向上させるフレームワークを開発する。
  • 探索と報酬の最適化を分離できる実用的なアクタークリティックアルゴリズムを、最大最小エントロピーフレームワークの下で設計し、複雑な環境における性能を向上させる。
  • 特に探索が重要なスパース報酬設定において、挑戦的な連続制御タスクで優れた性能を示す。

提案手法

  • 状態空間における最低エントロピー状態のエントロピーを最大化するように設計された最大最小エントロピー目的関数を提案する。これは高エントロピー状態を好むのではなく、低エントロピー状態に注目する。
  • 状態エントロピーのミニマックス最適化問題としてMME目的関数を定式化し、ポリシーが全状態における最小エントロピーを最大化するように訓練される。
  • 探索用のQ関数更新(低エントロピー状態を標的にする)とポリシー更新(ポリシー自身のエントロピー最大化を維持する)を分離する、分離型アクタークリティックアルゴリズムを実装する。
  • 訪問された状態のエントロピーを低く抑えるように促進する修正版Q学習更新を用いる一方で、報酬の最大化には標準的なソフトQ学習更新を維持する。
  • 二重最適化スキームを導入し、Q関数は訪問された状態のエントロピーを最小化するように最適化され、同時にポリシーは自らのエントロピーを最大化するように最適化される。
  • 純粋な探索と報酬付き環境の両方へフレームワークを適用し、密度報酬タスクでは探索と報酬の目的を分離する、分離型バージョン(DE-MME)を導入する。

実験結果

リサーチクエスチョン

  • RQ1オフポリシーな深層強化学習における関数近似を伴う最大最小エントロピーフレームワークは、探索性を向上させることができるか?
  • RQ2低エントロピー状態を標的にすることで、最大エントロピーRLと比較して、状態空間のカバレッジが向上し、正のフィードバックループが軽減されるか?
  • RQ3MMEフレームワークにおける探索と報酬の最適化の分離は、密度報酬環境における性能向上に寄与するか?
  • RQ4提案されたMMEアルゴリズムは、SAC、DAC、RNDといった最先端手法と比較して、スパース報酬制御タスクで優れた性能を示すか?
  • RQ5MMEの性能向上は、他の要因ではなく、主に改善された探索によるものであると見なせるか?

主な発見

  • DelayedHalfCheetah環境では、MMEアルゴリズムが平均報酬最大値3435.28 ± 39.55を達成し、SAC(817.40 ± 253.54)や他のベースラインを著しく上回った。
  • SparseWalker2dタスクでは、MMEが886.60 ± 25.77の報酬を達成し、SAC(817.40 ± 253.54)とRND(705.30 ± 274.88)を上回り、スパース報酬設定における強力な性能を示した。
  • 分離型バージョン(DE-MME)は、SparseAntで973.60 ± 12.55の報酬を達成し、MME(953.70 ± 28.39)および他のすべての手法を上回った。これは、探索と報酬の最適化を分離することの利点を示している。
  • 高次元密度報酬タスクであるHumanoidStandupでは、DE-MMEが250,935.53 ± 49,386.43の報酬を達成し、SAC(167,394.36 ± 7,291.99)とPPO(160,211.90 ± 3,268.37)を上回った。
  • アブレーションスタディの結果、MMEの性能向上は、最大最小エントロピー設計の意図通り、主に改善された探索によるものであることが確認された。
  • フレームワークは、高エントロピー状態への過剰な集中を避けることで、オフポリシー学習における正のフィードバックを軽減し、より広範かつ公平な状態空間探索を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。