Skip to main content
QUICK REVIEW

[論文レビュー] Action-depedent Control Variates for Policy Optimization via Stein's Identity

Hao Liu, Yihao Feng|arXiv (Cornell University)|Oct 30, 2017
Reinforcement Learning in Robotics被引用数 18
ひとこと要約

本稿では、ポリシー勾配強化学習における分散低減のための新規手法であるStein制御変数を提案する。この手法は、Steinの恒等式を用いて、行動および状態に依存するベースライン関数を構築することで、非線形で柔軟なベースラインを可能にしつつ、バイアスのない勾配推定を維持する。この方法により、複数の連続的制御環境において、サンプル効率が著しく向上し、PPOおよびTRPOの設定において、価値関数ベースラインやQ-propを上回る性能を発揮する。

ABSTRACT

Policy gradient methods have achieved remarkable successes in solving challenging reinforcement learning problems. However, it still often suffers from the large variance issue on policy gradient estimation, which leads to poor sample efficiency during training. In this work, we propose a control variate method to effectively reduce variance for policy gradient methods. Motivated by the Stein's identity, our method extends the previous control variate methods used in REINFORCE and advantage actor-critic by introducing more general action-dependent baseline functions. Empirical studies show that our method significantly improves the sample efficiency of the state-of-the-art policy gradient approaches.

研究の動機と目的

  • 深層強化学習におけるサンプル効率の低下を引き起こす、ポリシー勾配推定の高分散を是正すること。
  • ポリシー分布下で解析的に期待値がゼロとなるような、行動および状態に依存する制御変数の一般枠組みを構築すること。
  • REINFORCE、A2C、Q-propなどの既存の制御変数手法を拡張し、より表現力が高く非線形なベースライン関数を可能にすること。
  • 分散低減を通じて、PPO や TRPO などの最先端のポリシー最適化アルゴリズムのサンプル効率を向上させること。
  • Steinの恒等式を用いた理論的裏付けのある手法を提供し、先行手法を一般化しつつ、バイアスのない勾配推定を維持すること。

提案手法

  • ポリシー分布下で期待値がゼロとなる広範な関数のクラスを、Steinの恒等式を用いて導出することで、有効な制御変数を可能にする。
  • 状態や行動に依存するベースライン関数を構築し、従来の線形または状態のみに依存する制限を超える。
  • 再パラメータライゼーションのトリックをSteinの恒等式と組み合わせることで、微分可能かつスケーラブルな勾配推定を実現する。
  • 状態と行動の両方に依存する任意のベースライン関数を許容する一般化された制御変数の形を導出する。
  • MinVar や FitQ などの最適化目的関数を用いて、ベースライン関数のパラメータを学習し、勾配推定の分散を最小化する。
  • バイアスを導入せずに、PPO や TRPO などのポリシー最適化アルゴリズムに Stein 制御変数を統合する。

実験結果

リサーチクエスチョン

  • RQ1既存手法を上回る柔軟性を持ち、行動および状態に依存する制御変数を構築でき、勾配の分散を低減できるか?
  • RQ2Q-prop や A2C よりも広いクラスの有効な制御変数を、Steinの恒等式が可能にするか?
  • RQ3オフポリシーデータに依存せずに、Stein制御変数がサンプル効率を向上させられるか?
  • RQ4MLP や二次関数、線形関数などの異なるベースライン関数形の性能は、Stein制御変数と組み合わせた場合にどのように異なるか?
  • RQ5多様な連続的制御環境において、標準的な価値関数ベースラインや Q-prop を一貫して上回るか?

主な発見

  • Stein制御変数は、複数の環境において勾配の分散を顕著に低減し、PPO および TRPO におけるサンプル効率を向上させる。
  • Humanoid-v1 および HumanoidStandup-v1 では、MinVar+MLP ベースラインを用いた PPO が平均報酬 3847 ± 249.3 を達成し、同じ設定での価値関数ベースライン(128765 ± 13440)を上回った。
  • Hopper-v1 および Walker2d-v1 では、FitQ+Linear や MinVar+Linear を含む、すべての Stein 制御変数のバリエーションが、オフポリシーデータを使用していないにもかかわらず Q-prop を上回った。
  • 二次関数ベースラインは、期待よりも性能が低く、MLP や線形ベースラインと比較して収束が遅いために、学習の遅れが原因と考えられる。
  • MinVar+MLP は、他の設定と比較して一貫して優れた性能を示し、本手法の標準的な選択肢として強い候補である。
  • 本手法は環境間で一般化性に優れており、HalfCheetah-v1 や Ant-v1 など、他の環境でも、価値関数ベースラインを搭載した通常の PPO よりも一貫した改善を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。