Skip to main content
QUICK REVIEW

[論文レビュー] Marginalized State Distribution Entropy Regularization in Policy Optimization

Riashat Islam, Zafarali Ahmed|arXiv (Cornell University)|Dec 11, 2019
Reinforcement Learning in Robotics参考文献 26被引用数 7
ひとこと要約

本稿では、強化学習における状態空間カバレッジを向上させるために、潜在状態表現の変分下界を用いて時間的状態分布の周辺分布を近似する、周辺状態分布エントロピー正則化を提案する。この手法は、3D迷路やグリッドワールドなどのスパarsely-rewarded環境において、環境モデルを必要とせずに、行動空間の確率的性質を促進するのではなく、より広範な状態訪問を促すことで、優れた探索性能を達成する。

ABSTRACT

Entropy regularization is used to get improved optimization performance in reinforcement learning tasks. A common form of regularization is to maximize policy entropy to avoid premature convergence and lead to more stochastic policies for exploration through action space. However, this does not ensure exploration in the state space. In this work, we instead consider the distribution of discounted weighting of states, and propose to maximize the entropy of a lower bound approximation to the weighting of a state, based on latent space state representation. We propose entropy regularization based on the marginal state distribution, to encourage the policy to have a more uniform distribution over the state space for exploration. Our approach based on marginal state distribution achieves superior state space coverage on complex gridworld domains, that translate into empirical gains in sparse reward 3D maze navigation and continuous control domains compared to entropy regularization with stochastic policies.

研究の動機と目的

  • 方策エントロピー正則化の限界、すなわち行動空間の確率的性質を促進するが、状態空間のカバレッジを促進しないという点を是正すること。
  • スパarsely-rewarded環境における状態空間全体にわたる均一な探索を促進する、モデルフリーで取り扱いやすい方法の開発。
  • 周辺状態分布のエントロピーを最大化することが、標準的な方策エントロピー正則化よりも優れた状態空間カバレッジをもたらすことを示すこと。
  • 内在的キュリオシティやボーナスベースの手法とは異なり、状態訪問パターンに直接影響を与える勾配ベースの正則化項の提供。
  • 複雑なドメイン、特にスパarsely-rewardedな3D迷路や連続制御タスクにおける手法の妥当性の検証。

提案手法

  • 状態空間への均一な訪問を促進するために、周辺状態分布のエントロピー $\mathbb{H}(d_{t,\pi}(s))$ を最大化することを提案する。ここで $d_{t,\pi}(s)$ は $P_\pi(s_t = s)$ として定義される。
  • 状態 $s$ の潜在空間表現 $z$ を用いて、割合付き状態重み $d_{z,t,\pi}(s)$ の変分下界を用いることで、割合付き状態重みの推定を行う。
  • 真の周辺状態分布エントロピーの代わりに、実用的な近似 $\mathbb{H}(d_{z,t,\pi}(s))$ を導入し、方策勾配を用いたエンドツーエンド学習を可能にする。
  • 方策最適化の目的関数に、学習可能な重み係数 $\lambda_\pi$ を用いた正則化項としてエントロピー正則化を適用する。
  • 微分可能な最適化が可能となるように、潜在表現分布の推定に変分推論フレームワークを採用する。
  • 環境のダイナミクスや密度推定器を必要とせず、標準的な方策勾配アルゴリズム(例:SAC)に正則化を統合する。

実験結果

リサーチクエスチョン

  • RQ1周辺状態分布のエントロピーを最大化することは、強化学習における状態空間カバレッジを向上させることができるか?
  • RQ2スパarsely-rewarded環境において、周辺状態分布エントロピー正則化は、標準的な方策エントロピー正則化を上回る性能を示すか?
  • RQ3この手法は、遷移ダイナミクスや密度推定器へのアクセスを必要とせず、モデルフリーかつ微分可能に実装可能か?
  • RQ4本手法は、3D迷路ナビゲーションのような複雑でスパarsely-rewardedなタスクにおける学習効率と最終的パフォーマンスにどのように影響を与えるか?
  • RQ5最適方策学習とのトレードオフが生じる可能性があるにもかかわらず、本手法は密度報酬連続制御ドメインにも一般化可能か?

主な発見

  • 提案手法である周辺状態分布エントロピー正則化は、グリッドワールドや3D迷路環境において、標準的な方策エントロピー正則化に比べて顕著に状態空間カバレッジが向上することを示した。
  • スパarsely-rewardedな3D迷路ナビゲーションタスクにおいて、本手法は高いサンプル効率と高速な収束を達成し、困難な探索ベンチマークでの成功確率が向上した。
  • 内在的キュリオシティや MaxEntState と比較して、スパarsely-rewarded迷路における状態訪問の多様性と最終的パフォーマンスの両面で本手法が優れていることが確認された。
  • 密度報酬連続制御タスクでさえ、本手法はわずかだが測定可能な改善をもたらしたため、広範な適用可能性が示唆された。
  • 可視化結果から、周辺状態エントロピー正則化を用いて学習された方策は、特に初期学習段階においてより広範な状態を探索していることが確認された。
  • 環境モデルや密度推定、報酬形状の調整を一切必要としないため、実世界の強化学習応用において実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。