Skip to main content
QUICK REVIEW

[論文レビュー] Zeroth-order Deterministic Policy Gradient

Harshat Kumar, Dionysios S. Kalogerias|arXiv (Cornell University)|Jun 12, 2020
Reinforcement Learning in Robotics参考文献 36被引用数 5
ひとこと要約

本稿では、モデルフリーな強化学習アルゴリズムであるゼロ次決定的方策勾配(ZDPG)を提案する。ZDPGは、低次元の行動空間への摂動を用いてQ関数の二点ゼロ次オーダークエリにより方策勾配を推定し、クライアントを不要にする。ZDPGは、証明可能なアルゴリズムの安定性を達成し、有限サンプルの複雑さを最大で2桁改善し、システムノイズ下のナビゲーションタスクで標準PGおよびベースラインPGを上回る性能を発揮する。

ABSTRACT

Deterministic Policy Gradient (DPG) removes a level of randomness from standard randomized-action Policy Gradient (PG), and demonstrates substantial empirical success for tackling complex dynamic problems involving Markov decision processes. At the same time, though, DPG loses its ability to learn in a model-free (i.e., actor-only) fashion, frequently necessitating the use of critics in order to obtain consistent estimates of the associated policy-reward gradient. In this work, we introduce Zeroth-order Deterministic Policy Gradient (ZDPG), which approximates policy-reward gradients via two-point stochastic evaluations of the $Q$-function, constructed by properly designed low-dimensional action-space perturbations. Exploiting the idea of random horizon rollouts for obtaining unbiased estimates of the $Q$-function, ZDPG lifts the dependence on critics and restores true model-free policy learning, while enjoying built-in and provable algorithmic stability. Additionally, we present new finite sample complexity bounds for ZDPG, which improve upon existing results by up to two orders of magnitude. Our findings are supported by several numerical experiments, which showcase the effectiveness of ZDPG in a practical setting, and its advantages over both PG and Baseline PG.

研究の動機と目的

  • クライアントに依存しない真のモデルフリー方策学習を、決定的方策勾配手法において回復すること。
  • 証明可能な安定性を持つゼロ次オーダー勾配推定フレームワークを用いて、標準方策勾配手法の不安定さと高い分散を是正すること。
  • 高次元の摂動に依存するのを減らし、クライアントバイアスを低減することで、強化学習における有限サンプル収束レートを改善すること。
  • 摂動を低次元の行動空間で行うことで、高次元の方策空間における効率的かつスケーラブルな方策最適化を可能にすること。
  • 最小限のモンテカルロ分散低減を伴うノイズのある実用的環境において、標準PGおよびベースラインPG手法に比べて頑健で優れた性能を示すこと。

提案手法

  • ZDPGは、初期行動の周囲における低次元の行動空間への摂動を用いた、Q関数の確率的評価を通じて、方策報酬勾配の二点ゼロ次オーダー推定を構築する。
  • 無作為なホライズンのロールアウトを活用して、バイアスのないノイズのあるQ関数推定を取得し、クライアントフリーな勾配近似を可能にする。
  • 行動摂動を通じて滑らかな代替目的関数を導入し、ヒューリスティックなベースライン手法を用いずに、準勾配分散の安定性を保証する。
  • 1エピソードあたり1回または2点のQ評価を用いることで、更新ごとにたった2回のシステムロールアウトで済ませ、計算オーバーヘッドを顕著に削減する。
  • 摂動の大きさを制御するスムージングパラメータμを採用し、勾配近似の推定精度と分散のバランスを取る。
  • 標準的な正則性条件(Lipschitz Q関数、ヘッセ行列のLipschitz性)の下で有限サンプル収束解析を実施し、先行のゼロ次オーダー手法に比べて改善された複雑さの上限を導出する。

実験結果

リサーチクエスチョン

  • RQ1決定的方策勾配手法は、価値関数クライアントに依存せずに真のモデルフリー学習を達成できるか?
  • RQ2高次元の方策空間において、摂動次元を最小限に抑えると同時に、ゼロ次オーダー勾配推定を効率的かつ安定的に実現できるか?
  • RQ3標準的な正則性仮定の下で、ゼロ次オーダー決定的方策勾配手法の有限サンプル収束レートは何か?
  • RQ4システムノイズ下において、ZDPGは標準PGおよびベースラインPG手法と比べて、サンプル効率と頑健性の面でどのように差をつけるか?
  • RQ5クライアントベースの価値関数近似なしに、ゼロ次オーダー手法が連続制御タスクにおいて証明可能な安定性と改善された収束レートを達成できるか?

主な発見

  • ZDPGは、Grad-Lipschitzおよびヘッセ行列のLipschitz性を満たすQ関数の仮定の下で、既存のゼロ次オーダー手法に比べ、有限サンプルの複雑さの上限で最大2桁の改善を達成する。
  • システムノイズ ω = 0.1 がかかるナビゲーションタスクにおいて、ZDPG-Sは特にモンテカルロ分散低減を適用しない場合(N=1)にPG-Bを一貫して上回り、優れたノイズ耐性を示す。
  • ZDPG-Sは長期間の評価ホライズン(T=100)においても安定した学習曲線を維持するが、PG-Bは長期間にわたり最適でない徘徊を示し、ターゲットに到達できない。
  • PG-Bでベースライン価値関数の複数ロールアウト推定を用いても、ZDPG-Sは1エピソードあたり2回のロールアウトのみで、依然として優れた性能を発揮する。これは、ZDPGの効率性と頑健性を示している。
  • ZDPGにおける無作為な方策の排除により、複数のノイズレベルおよびロールアウト長での学習曲線から、より速く一貫性のある収束が確認された。
  • 提案手法は、ヒューリスティックなベースライン技術とは対照的に、非ヒューリスティックで決定的方策に基づく勾配推定により、証明可能な分散安定性を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。