Skip to main content
QUICK REVIEW

[論文レビュー] Boosting Trust Region Policy Optimization by Normalizing Flows Policy

Yunhao Tang, Shipra Agrawal|arXiv (Cornell University)|Sep 27, 2018
Reinforcement Learning in Robotics参考文献 23被引用数 20
ひとこと要約

本論文では、探索の効率を高めるために、正規化フロー(NF)をポリシー構造として用いることを提案する。これにより、多様で非ガウス分布である行動分布を生成可能となり、信頼領域ポリシーオプティマイゼーション(TRPO)におけるKLダイバージェンス制約の制限的影響を軽減する。NFポリシーは、特に高次元で複雑な制御タスクにおいて、収束が速く、性能が優れている。TRPOおよびACKTRフレームワークにおいて、標準的なガウスポリシーを上回る性能を発揮する。

ABSTRACT

We propose to improve trust region policy search with normalizing flows policy. We illustrate that when the trust region is constructed by KL divergence constraints, normalizing flows policy generates samples far from the 'center' of the previous policy iterate, which potentially enables better exploration and helps avoid bad local optima. Through extensive comparisons, we show that the normalizing flows policy significantly improves upon baseline architectures especially on high-dimensional tasks with complex dynamics.

研究の動機と目的

  • 標準的なガウスポリシーの代わりに、より表現力のある正規化フロー(NF)ポリシーを用いることで、信頼領域ポリシーオプティマイゼーション(TRPO)を改善すること。
  • NFポリシーがTRPOにおけるKLダイバージェンス制約の制限的影響を軽減し、より良い探索とより速い収束を可能にするかどうかを調査すること。
  • 複雑なダイナミクスを示す多様な高次元制御タスクにおいて、NFポリシーのロバストネスと性能を評価すること。
  • TRPOおよびACKTRフレームワークにおけるベースラインアーキテクチャ(例:因子化ガウス)と比較し、サンプル効率および漸近的性能の向上を評価すること。

提案手法

  • 連続的正規化フローに基づくポリシーのパラメータ化として正規化フロー(NF)を採用し、柔軟で多次元的かつ相関のある行動分布を可能にする。
  • 訓練の安定性を保つために、連続するポリシー間のKLダイバージェンスの信頼領域制約を維持しつつ、NFポリシーをTRPOおよびACKTRに統合する。
  • K個のカップリング層を有する正規化フローを用い、各層が学習可能なパrameterを持つ可逆変換を適用する。また、状態をニューラルネットワークの埋め込みによって条件付きに処理する。
  • 計算の実行可能性を確保するため、Fisher情報行列を用いてKLダイバージェンス制約を近似し、信頼領域の幾何的性質を保持する。
  • NFポリシーの尤度比を変数変換の公式により計算し、アドバンテージ重み付きポリシー勾配更新を用いて、オンポリシーのロールアウトでポリシーを訓練する。
  • 状態に依存するフローを適用する:NFの入力は2層のMLPによる状態埋め込みであり、これによりポリシーは状態ごとに複雑な行動分布を適応的にモデル化可能となる。

実験結果

リサーチクエスチョン

  • RQ1正規化フロー(NF)ポリシーは、KLダイバージェンス制約の制限的影響を軽減することで、信頼領域ポリシーオプティマイゼーション(TRPO)における探索性を向上させることができるか?
  • RQ2複雑なダイナミクスを示す高次元制御タスクにおいて、NFポリシーの性能は標準的なガウスポリシーと比べてどのように異なるか?
  • RQ3正規化フローの使用により、KL制約閾値εのようなハイパーパrameterの選択に対してロバストネスが向上するか?
  • RQ4TRPOおよびACKTRと組み合わせた場合、NFポリシーはどの程度サンプル効率および最終的性能を向上させるか?

主な発見

  • 正規化フロー(NF)ポリシーは、高次元のMuJoCoおよびRoboschoolタスクにおいて、因子化ガウスポリシーを著しく上回り、特にAntおよびHumanoid環境では、漸近的リターンがそれぞれ約800および2000に達する。
  • HalfCheetahタスクでは、NFポリシーは約1500のリターンを達成するが、ガウスポリシーは学習に失敗し(リターン ≈ 0)、複雑なダイナミクス下での性能差が顕著に現れる。
  • NFポリシーはハイパーパrameter設定、特にKL制約閾値εに対して優れたロバストネスを示す。これは、小さなε値でも制限の強いサンプリング行動が抑えられるためである。
  • ACKTRフレームワークにおいても、NFポリシーはAntやHumanoidのような複雑なタスクでガウスポリシーを常に上回り、Humanoidでは2000対550の性能向上を達成する。
  • いくつかのベンチマークで、NFポリシーは最先端の性能を達成しており、以前の研究(例:Schulman et al., 2017b; Wu et al., 2017)で報告された結果と同等またはそれを上回る。これは、少ない訓練ステップ数でも達成可能である。
  • アブレーションスタディにより、NFポリシーの性能は、フローレイヤー数(K ∈ {2,4,6})および隠れユニットサイズ(l₁ ∈ {3,5,7})の変化に対してもロバストであることが確認され、安定的かつスケーラブルな設計であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。