Skip to main content
QUICK REVIEW

[論文レビュー] Differentiable Trust Region Layers for Deep Reinforcement Learning

Fabian Otto, Philipp Becker|arXiv (Cornell University)|Jan 22, 2021
Reinforcement Learning in Robotics参考文献 30被引用数 6
ひとこと要約

本稿では、KLダイバージェンス、ワッサーシュタインL2距離、フロベニウスノルムに基づく閉形式の射影を用いて、状態別にポリシー制約を強制する微分可能信頼領域射影層を導入する。この手法は、PPO や TRPO と同等またはそれ以上の性能を達成するとともに、より安定で実装の選択に敏感ではなく、スパース報酬制御タスクにおいて実証的に検証されている。

ABSTRACT

Trust region methods are a popular tool in reinforcement learning as they yield robust policy updates in continuous and discrete action spaces. However, enforcing such trust regions in deep reinforcement learning is difficult. Hence, many approaches, such as Trust Region Policy Optimization (TRPO) and Proximal Policy Optimization (PPO), are based on approximations. Due to those approximations, they violate the constraints or fail to find the optimal solution within the trust region. Moreover, they are difficult to implement, often lack sufficient exploration, and have been shown to depend on seemingly unrelated implementation choices. In this work, we propose differentiable neural network layers to enforce trust regions for deep Gaussian policies via closed-form projections. Unlike existing methods, those layers formalize trust regions for each state individually and can complement existing reinforcement learning algorithms. We derive trust region projections based on the Kullback-Leibler divergence, the Wasserstein L2 distance, and the Frobenius norm for Gaussian distributions. We empirically demonstrate that those projection layers achieve similar or better results than existing methods while being almost agnostic to specific implementation choices. The code is available at https://git.io/Jthb0.

研究の動機と目的

  • 深強化学習における既存の信頼領域手法の不安定さと実装への感受性を解消すること。
  • ガウス分布ポリシーに対して正確で状態依存の信頼領域制約を強制し、単調増加の改善保証を可能にすること。
  • ポリシー更新を信頼領域に射影する閉形式解を用いた微分可能なニューラルネットワークレイヤーを開発すること。
  • ポリシー最適化に与える影響を評価するため、KLダイバージェンス、ワッサーシュタインL2、フロベニウスノルムといった異なる類似性測度の比較。
  • ペナルティに基づく回帰による信頼領域射影の近似が、計算コストを削減しながら正確な射影を効果的に近似できることを示すこと。

提案手法

  • 古いポリシーで定義される信頼領域に更新されたポリシーを射影する微分可能なニューラルネットワークレイヤーを提案し、ガウス分布に対して閉形式解を用いる。
  • 信頼領域を定義するために、カルバック・ライブララー距離、ワッサーシュタインL2距離、フロベニウスノルムの3つの類似性測度を採用する。
  • 射影されたポリシーが元のポリシーに近くなるようにペナルティ項を含む信頼領域回帰損失を導入し、正確な信頼領域更新を近似する。
  • 完全な反復的射影ではなく、ペナルティベースの最適化を用いることで、標準的なディープラーニングフレームワークでの効率的な学習を可能にする。
  • 挑戦的な環境における探索の向上を図るため、エントロピー制御をフレームワークに統合する。
  • オンポリシー学習パイプライン内にレイヤーを適用し、PPO などの既存の強化学習アルゴリズムとシームレスに統合できる。

実験結果

リサーチクエスチョン

  • RQ1微分可能信頼領域レイヤーは、期待されるポリシー変化にのみ制約を課す既存手法よりも、よりきめ細やかで状態別に強いポリシー制約を課すことができるか?
  • RQ2KLダイバージェンス、ワッサーシュタインL2、フロベニウスノルムといった異なる類似性測度が、ポリシー最適化と最終的なパフォーマンスに与える影響は何か?
  • RQ3信頼領域射影のペナルティベース近似が、制約の強制と学習の安定性をどれほど維持できるか?
  • RQ4スパース報酬環境において、探索が重要となる状況で、提案手法がパフォーマンスを向上させられるか?
  • RQ5PPO や TRPO と比較して、この手法は実装レベルのハイパーパrameterに対してどれほど感受性を示すか?

主な発見

  • 信頼領域レイヤーは、特にスパース報酬設定において、PPO や TRPO と同等またはそれ以上のパフォーマンスを複数の MuJoCo 環境で達成する。
  • KLベースの射影が最も優れたパフォーマンスを示すが、数値最適化を要する。一方、ワッサーシュタインL2射影はハイパーパrameterの選択に対してよりロバストで、計算が速い。
  • 共分散が収束に近づくと非常に小さくなる状況で、フロベニウスノルム射影は数値的不安定性を示し、効果が制限される。
  • スパース報酬が課せられる5リンクリーチャ環境では、文脈依存の共分散を用いた場合、提案手法がベースラインを著しく上回る。
  • ペナルティベースの回帰近似は、信頼領域制約を効果的に維持でき、完全な反復的射影を用いなくても安定した学習を可能にする。
  • 報酬スケーリング、クリッピング、価値関数正規化の有無に依存する度合いが低いため、PPO よりも実装レベルの選択に敏感でないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。