Skip to main content
QUICK REVIEW

[論文レビュー] Policy Optimization for Continuous Reinforcement Learning

Hanyang Zhao, Wenpin Tang|arXiv (Cornell University)|May 30, 2023
Advanced Multi-Objective Optimization Algorithms被引用数 6
ひとこと要約

本稿は、確率的微分方程式を用いて強化学習の連続時間方策最適化フレームワークを構築し、割引報酬目的のための新しい訪問時間測度を導入する。性能差分および局所近似の公式を導出し、時間・空間の離散化なしに方策勾配およびTRPO/PPOの連続的対応手法を可能にする。実験により収束性と離散ベースラインより優れた性能が示された。

ABSTRACT

We study reinforcement learning (RL) in the setting of continuous time and space, for an infinite horizon with a discounted objective and the underlying dynamics driven by a stochastic differential equation. Built upon recent advances in the continuous approach to RL, we develop a notion of occupation time (specifically for a discounted objective), and show how it can be effectively used to derive performance-difference and local-approximation formulas. We further extend these results to illustrate their applications in the PG (policy gradient) and TRPO/PPO (trust region policy optimization/ proximal policy optimization) methods, which have been familiar and powerful tools in the discrete RL setting but under-developed in continuous RL. Through numerical experiments, we demonstrate the effectiveness and advantages of our approach.

研究の動機と目的

  • 割引報酬目的における離散MDPにおける訪問頻度(訪問時間)の連続時間版を確立すること。
  • 摂動解析を用いて連続時間強化学習における性能差分および局所近似の公式を導出すること。
  • 事前の時間または空間の離散化なしに、方策勾配(PG)、TRPO、PPOの連続時間版を開発すること。
  • 提案手法の収束性および連続確率的制御タスクにおける性能向上を実証すること。

提案手法

  • 連続時間確率的制御における割引報酬目的に特化した新しい訪問時間の概念を導入する。
  • 摂動解析を用いて、方策の変更と性能の変化の間の関係を示す性能差分の公式を導出する。
  • 性能指標の局所近似を構築し、証明可能なバインドを提供することで、最小化-最大化(MM)アルゴリズム設計を可能にする。
  • 導出した公式を用いて、離散手法を連続ダイナミクスに適応させることで、連続時間PG、TRPO、PPOの変種を提案する。
  • 方策関数および価値関数にニューラルネットワークをパラメータ化し、サンプルされた軌道に基づく勾配更新を実施する。
  • CPPOでは平方根および線形KLダイバージェンスを用いて方策更新を制御し、アブレーションにより平方根バージョンがより優れた収束を示すことを確認した。
Figure 1: Convergence of $\theta$ in $l_{2}$ distance
Figure 1: Convergence of $\theta$ in $l_{2}$ distance

実験結果

リサーチクエスチョン

  • RQ1割引報酬を持つ離散MDPにおける訪問頻度(訪問時間)の連続時間版は何か?
  • RQ2離散MDPと同様の性能差分の公式を連続時間強化学習で導出可能か?
  • RQ3信頼領域およびプロキシマル方策最適化手法を連続時間・連続空間強化学習にどのように適応できるか?
  • RQ4提案された連続時間方策最適化手法は、収束性および安定性の面でその離散時間版を上回ることができるか?

主な発見

  • 提案された連続時間方策勾配(CPG)およびCPPO手法は、確率的制御タスクにおける数値実験で最適方策に収束した。
  • 平方根KLダイバージェンスを用いたCPPOは線形KLバージョンを上回り、局所最適解を避けることができ、より安定した収束を示した。
  • CPGおよびCPPOは、粗い時間離散化(δt = 0.1)でさえも、離散時間PGおよびPPOと同等または優れた性能を達成しており、連続的定式化の潜在的利点を示唆している。
  • 連続的フレームワークにより、時間的・空間的離散化を明示的に行わずとも方策最適化が可能となり、元のSDEダイナミクスの連続性が保たれた。
  • 性能差分の公式により、方策改善の正確な推定が可能となり、本手法の理論的基盤の妥当性が裏付けられた。
  • 時間離散化に対して本手法は頑健であり、異なるδt値での実験で一貫した性能を示した。
Figure 2: Convergence of $\pi_{\theta}$ in KL-divegence
Figure 2: Convergence of $\pi_{\theta}$ in KL-divegence

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。