Skip to main content
QUICK REVIEW

[論文レビュー] Path Consistency Learning in Tsallis Entropy Regularized MDPs

Ofir Nachum, Yinlam Chow|arXiv (Cornell University)|Feb 10, 2018
Reinforcement Learning in Robotics参考文献 26被引用数 9
ひとこと要約

本稿では、Tsallisエントロピー正則化付きマルコフ決定過程におけるスパースパス整合性学習(sparse PCL)という、新しいアクタクリティックアルゴリズムを提案する。この手法は、少数の行動にのみ非ゼロ確率を割り当てるスパースな方策を誘導する。マルチステップのスパース整合性方程式を導出し、オンポリシーおよびオフポリシーの両方のデータを活用することで、大規模な行動空間において、ソフトPCLよりも優れた性能を達成する。収束が速く、近似的に決定論的な方策に到達し、最終的な報酬も顕著に向上する。

ABSTRACT

We study the sparse entropy-regularized reinforcement learning (ERL) problem in which the entropy term is a special form of the Tsallis entropy. The optimal policy of this formulation is sparse, i.e.,~at each state, it has non-zero probability for only a small number of actions. This addresses the main drawback of the standard Shannon entropy-regularized RL (soft ERL) formulation, in which the optimal policy is softmax, and thus, may assign a non-negligible probability mass to non-optimal actions. This problem is aggravated as the number of actions is increased. In this paper, we follow the work of Nachum et al. (2017) in the soft ERL setting, and propose a class of novel path consistency learning (PCL) algorithms, called {\em sparse PCL}, for the sparse ERL problem that can work with both on-policy and off-policy data. We first derive a {\em sparse consistency} equation that specifies a relationship between the optimal value function and policy of the sparse ERL along any system trajectory. Crucially, a weak form of the converse is also true, and we quantify the sub-optimality of a policy which satisfies sparse consistency, and show that as we increase the number of actions, this sub-optimality is better than that of the soft ERL optimal policy. We then use this result to derive the sparse PCL algorithms. We empirically compare sparse PCL with its soft counterpart, and show its advantage, especially in problems with a large number of actions.

研究の動機と目的

  • 標準的なShannonエントロピー正則化RLの限界に対処する。特に大規模な行動空間では、最適方策が非最適な行動に非無視可能な確率を割り当ててしまう。
  • Shannonエントロピーの代わりにTsallisエントロピー正則化を用いることで、最適方策にスパarsityを誘導する原理的かつ整合的な手法を開発する。
  • 元々Shannonエントロピー用に設計されたパス整合性学習(PCL)フレームワークを、スパース(Tsallis)エントロピー設定に拡張する。
  • スパース設定において、オンポリシーおよびオフポリシーの両方のデータを活用し、データ効率と安定性を維持する。
  • 実験的に、スパースPCLが最終的報酬および収束速度の面でソフトPCLを上回ることを示す。特に高次元の行動空間において顕著である。

提案手法

  • Tsallisエントロピー正則化付きMDPにおける最適価値関数と方策の関係を特徴付けるマルチステップのスパース整合性方程式を導出する。
  • 最適性はスパース整合性を含むが、逆は部分最適性を意味し、行動空間のサイズが大きくなるほど部分最適性のギャップが改善されることを証明する。
  • スパース整合性方程式に基づく損失関数を最小化するように設計されたスパースPCLアルゴリズムを提案し、価値関数と方策ネットワークの共同学習を可能にする。
  • 現在のポリシーからの部分軌道とリプレイバッファを用いることで、オンポリシーおよびオフポリシーの両方のデータをサポートし、データ効率を向上させる。
  • 高次元の状態および行動空間へのスケーリングを実現するため、ニューラルネットワークによる関数近似を実装する。
  • 温度パラメータを用いてスパarsityを制御し、方策分布における探索と活用のトレードオフを可能にする。

実験結果

リサーチクエスチョン

  • RQ1PCLのような整合性に基づくフレームワークを、Tsallisエントロピー正則化付きMDPに拡張し、スパースな方策を誘導できるか?
  • RQ2行動数が増加する際、スパース整合性条件を満たす方策の部分最適性は最適方策と比べてどの程度か?
  • RQ3大規模な行動空間を有する環境において、スパースPCLはソフトPCLよりも優れた最終的性能とより速い収束を達成できるか?
  • RQ4高次元連続制御タスクにおいて、粗い離散化を施した後、スパースPCLは近似的に決定論的な方策を効果的に学習できるか?
  • RQ5アルゴリズム的タスクおよび連続制御ベンチマークを含め、さまざまな種類のタスクにおいて、スパースPCLのソフトPCLに対する優位性は一貫しているか?

主な発見

  • 行動空間のサイズが増加するアルゴリズム的タスクにおいて、スパースPCLはソフトPCLを上回る。|A|が100を超えると、性能差が広がる。
  • |A| = 3^6 = 729 および |A| = 5^6 = 15,625 の場合、行動を離散化したHalfCheetah環境において、スパースPCLはソフトPCLよりも顕著に高い平均報酬を達成する。
  • スパースPCLは、ソフトPCLよりもはるかに速く近似的に決定論的な方策に収束する。100万ステップ以内に、最も確率の高い行動の平均確率が0.95を超える。
  • ソフトPCLは最適な行動に確率質量を集中させることができず、100万ステップ経過しても最も確率の高い行動の平均確率が0.75未満のままにとどまる。
  • スパース整合性を満たす方策の理論的部分最適性バウンディングは、行動空間のサイズが大きくなるほど改善され、大規模な行動空間ではソフトPCLの最適方策よりも優位になる。
  • 実験結果から、ソフトPCLが長期間にわたり非最適な行動を過剰に探索することで性能が著しく損なわれる傾向があることが確認され、スパースPCLはこの問題を効果的に緩和している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。