Skip to main content
QUICK REVIEW

[論文レビュー] Proximal Policy Optimization with Relative Pearson Divergence

Taisuke Kobayashi|arXiv (Cornell University)|Oct 7, 2020
Reinforcement Learning in Robotics参考文献 30被引用数 4
ひとこと要約

本稿では、PPOのヒューリスティックなクリッピングを相対ピアソン差分(RPE)に基づく正則化に置き換えるPPO-RPEという、新しいプロキシマル・ポリシー最適化の変種を提案する。これにより、理論的に整合性のある最小化ターゲットとバランスの取れたポリシー更新が得られる。PPO-RPEは、4つのベンチマークタスクにおいて優れたもしくは同等の性能を達成しており、ベースラインへのポリシー更新の制約をより効果的に行うことで、学習の安定性と収束性が向上する。

ABSTRACT

The recent remarkable progress of deep reinforcement learning (DRL) stands on regularization of policy for stable and efficient learning. A popular method, named proximal policy optimization (PPO), has been introduced for this purpose. PPO clips density ratio of the latest and baseline policies with a threshold, while its minimization target is unclear. As another problem of PPO, the symmetric threshold is given numerically while the density ratio itself is in asymmetric domain, thereby causing unbalanced regularization of the policy. This paper therefore proposes a new variant of PPO by considering a regularization problem of relative Pearson (RPE) divergence, so-called PPO-RPE. This regularization yields the clear minimization target, which constrains the latest policy to the baseline one. Through its analysis, the intuitive threshold-based design consistent with the asymmetry of the threshold and the domain of density ratio can be derived. Through four benchmark tasks, PPO-RPE performed as well as or better than the conventional methods in terms of the task performance by the learned policy.

研究の動機と目的

  • 標準PPOにおける明確でない最小化ターゲットの問題に対処すること。これは、原理的な正則化目的が欠如しているためである。
  • 非対称な密度比に適用される対称的なクリッピング閾値によって引き起こされるポリシー正則化の不均衡を解消すること。
  • 相対ピアソン差分(RPE)に基づく、直感的ではあるが理論的に厳密な閾値ベースの正則化手法を導出すること。
  • ポリシー更新におけるRPE差分を明示的に最小化することで、深層強化学習の学習安定性と性能を向上させること。

提案手法

  • PPOの密度比クリッピングを、明確な最小化ターゲットを提供する相対ピアソン差分(RPE)に基づく正則化項に置き換える。
  • 対称的な閾値を相対密度比領域にマッピングすることで、RPE正則化のための閾値ベースのゲインを導出する。これにより、密度比の非対称性と整合性を保つ。
  • RPE差分をソフト制約として用い、最新のポリシーとベースラインポリシーとの距離を最小化することで、安定的かつ滑らかなポリシー更新を促進する。
  • 正則化強度を制御するための閾値パラメータεを用いる。直感的な設計を保ちつつ、理論的根拠を確保する。
  • RPE正則化をポリシー最適化ターゲットに統合し、アドバンテージに基づく学習および追加の正則化(例:エントロピー正則化やTD正則化)と組み合わせる。
  • 頑健な最適化手法(td-AmsProp)を用い、メモリコストを低減するため経験リプレイを回避する。代わりに、効率的な学習を実現するための適応的エリギビリティトレースに焦点を当てる。

実験結果

リサーチクエスチョン

  • RQ1RPEに基づく正則化は、標準PPOにおけるヒューリスティックなクリッピングよりも、より明確で原理的根拠のある最小化ターゲットを提供できるか?
  • RQ2RPE差分を用いることで、非対称な密度比に適用される対称的クリッピングと比較して、よりバランスの取れた効果的なポリシー正則化が達成できるか?
  • RQ3PPO-RPEは、多様な強化学習ベンチマークにおいて、PPOおよびPPO-RBと同等または優れたタスク性能を達成できるか?
  • RQ4訓練中に、PPO-RPEにおけるポリシー正則化の強度と一貫性は、従来の手法と比較してどう異なるか?

主な発見

  • PPO-RPEは、HalfCheetahのような複雑な運動タスクを含む4つのベンチマークタスクすべてで、PPOおよびPPO-RBを上回るか同等の性能を示した。
  • HalfCheetahでは、局所最適解を回避するのに寄与する、より強力で一貫性のある正則化のおかげで、優れた性能を発揮した。
  • PPO-RPEにおける正則化項は、訓練全体を通して活性化し続けた。これは、PPOやPPO-RBが閾値内に入った段階ですぐに正則化を解除するのとは対照的である。
  • PPOおよびPPO-RBと比較して、PPO-RPEは低次元および高次元の制御タスクの両方で、より速い学習収束を示した。
  • 正則化の程度(σ(ρ−ρ†))は、PPO-RPEにおいて一貫して高く、より強く一貫性のあるポリシー制約であることを確認した。
  • 理論的分析により、RPEに基づく正則化が明確な最小化ターゲットを提供することを確認した。これにより、標準PPOの最適化ターゲットにおける曖昧さが解消された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。