[論文レビュー] Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning
本稿では、連続制御タスクにおける安定で高性能な学習を可能にする、オフポリシーでモデルフリーな最大エントロピー深層強化学習アルゴリズムであるDeep Soft Policy Gradient(DSPG)を提案する。DSPGは、ソフトポリシー勾配と二重サンプリングに基づくソフトベルマン方程式を組み合わせることで、安定した学習を実現する。DSPGは、Ant、HalfCheetah、Hopper、Walker2dといったベンチマーク環境において、サンプル効率、最終的パフォーマンス、訓練安定性の面でDDPGおよびSACを上回る性能を発揮する。
Maximum entropy deep reinforcement learning (RL) methods have been demonstrated on a range of challenging continuous tasks. However, existing methods either suffer from severe instability when training on large off-policy data or cannot scale to tasks with very high state and action dimensionality such as 3D humanoid locomotion. Besides, the optimality of desired Boltzmann policy set for non-optimal soft value function is not persuasive enough. In this paper, we first derive soft policy gradient based on entropy regularized expected reward objective for RL with continuous actions. Then, we present an off-policy actor-critic, model-free maximum entropy deep RL algorithm called deep soft policy gradient (DSPG) by combining soft policy gradient with soft Bellman equation. To ensure stable learning while eliminating the need of two separate critics for soft value functions, we leverage double sampling approach to making the soft Bellman equation tractable. The experimental results demonstrate that our method outperforms in performance over off-policy prior methods.
研究の動機と目的
- 高次元の連続制御タスクにおける、DDPGのようなオンポリシー手法の不安定さと低いサンプル効率を解消すること。
- 連続アクション空間において複雑なサンプリング手順を必要とする、オフポリシー価値ベース手法の限界を克服すること。
- 最大エントロピーフレームワーク下で、安定的でスケーラブルかつサンプル効率の高い深層強化学習アルゴリズムを開発し、探索性とロバスト性を向上させること。
- 二重のクライアントを必要としない単一のクライアントに二重サンプリングを適用することで、ソフトQ学習における2つのクライアントの必要性を排除し、近似誤差を低減し、訓練安定性を向上させること。
- 挑戦的な連続制御ベンチマークにおいて、DDPG や SAC といった先行のオフポリシー手法と比較して、優れたパフォーマンスと安定性を達成すること。
提案手法
- 連続アクション空間における確率的ポリシーの最適化を目的としたエントロピー正則化期待報酬目的関数からソフトポリシー勾配を導出する。
- 2つの深層ニューラルネットワーク(1つは確率的ポリシー(エージェント)、もう1つはソフトQ関数(クライアント))を用いたオフポリシーのアクタクリティックフレームワークを構築する。
- ソフトベルマン方程式を扱いやすくかつ安定させるために、二重サンプリングアプローチを導入し、2つの別個のクライアントを必要としない。
- ポリシー更新の安定性を確保するため、ポリシー改善の大きさを制約するクリッピングソフトポリシー勾配を適用する。
- 300万件の遷移を保持するリプレイバッファを用い、100件のミニバッチで学習を行い、環境ステップごとに4ステップごとにポリシーを更新する。
- エージェントとクライアントそれぞれに別々の学習率を設定したAdam最適化手法を採用し、安定性を高めるために0.01の更新係数を用いたソフトターゲット更新を実施する。
実験結果
リサーチクエスチョン
- RQ1最大エントロピーフレームワーク下で、高次元の連続制御タスクにおいて安定したオフポリシー学習を可能にするソフトポリシー勾配手法を導出できるか?
- RQ2ソフトベルマン方程式における二重サンプリングの使用が、先行のソフトQ学習手法と比較して、安定性を向上させるとともに2つのクライアントの必要性を排除する仕組みはどのように機能するか?
- RQ3標準的な連続制御ベンチマークにおいて、DSPGはDDPGおよびSACと比較して、どの程度サンプル効率と最終的パフォーマンスが向上するか?
- RQ4ソフトポリシー勾配と二重サンプリングに基づくソフトQ関数学習の組み合わせが、よりロバストで安定した訓練ダイナミクスをもたらすか?
- RQ53Dヒューマノイドの歩行など、状態空間およびアクション空間の次元が異なる多様なタスクにおいて、DSPGは効果的に一般化できるか?
主な発見
- DSPGは、Ant-v2、HalfCheetah-v2、Hopper-v2、Walker2d-v2の4つのベンチマーク環境すべてにおいて、最終的パフォーマンスとサンプル効率の両面でDDPGを顕著に上回る。
- Hopper-v2およびWalker2d-v2では、DSPGが平均総報酬を3674.029および6060.884とし、SACの3652.893および5520.419を上回る。
- Ant-v2では、DSPGが最高平均総報酬3384.074を達成し、DDPG(1012.242)を大きく上回り、SACの最高パフォーマンス3472.346と同等の性能を発揮する。
- 訓練曲線から、DSPGはSACと比較して優れた安定性を示しており、すべてのタスクでばらつきが少なく、一貫した改善が見られる。
- クリッピングソフトポリシー勾配と二重サンプリングを用いた単一クライアントの組み合わせが、近似誤差の低減と訓練安定性の向上に寄与している。
- 2つのクライアントに依存しないにもかかわらず、SACが2つのクライアントに依存しているのと同等の性能を維持していることから、二重サンプリングアプローチの有効性が裏付けられている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。