Skip to main content
QUICK REVIEW

[論文レビュー] PTR-PPO: Proximal Policy Optimization with Prioritized Trajectory Replay

Xingxing Liang, Yang Ma|arXiv (Cornell University)|Dec 7, 2021
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

この論文は、オンポリシー学習に優先順位付き軌道リプレイを統合することで、サンプル効率を向上させる新しいプロキシマル・ポリシー最適化(PTR-PPO)アルゴリズムを提案する。GAE値と累積報酬に基づいて軌道を優先順位付けし、オフポリシー更新の安定化のための切り捨てられた重要度重みを用いることで、PTR-PPOはアタリゲームにおいて最先端の性能を達成し、標準PPOおよび既存のオフポリシー基準を上回る。

ABSTRACT

On-policy deep reinforcement learning algorithms have low data utilization and require significant experience for policy improvement. This paper proposes a proximal policy optimization algorithm with prioritized trajectory replay (PTR-PPO) that combines on-policy and off-policy methods to improve sampling efficiency by prioritizing the replay of trajectories generated by old policies. We first design three trajectory priorities based on the characteristics of trajectories: the first two being max and mean trajectory priorities based on one-step empirical generalized advantage estimation (GAE) values and the last being reward trajectory priorities based on normalized undiscounted cumulative reward. Then, we incorporate the prioritized trajectory replay into the PPO algorithm, propose a truncated importance weight method to overcome the high variance caused by large importance weights under multistep experience, and design a policy improvement loss function for PPO under off-policy conditions. We evaluate the performance of PTR-PPO in a set of Atari discrete control tasks, achieving state-of-the-art performance. In addition, by analyzing the heatmap of priority changes at various locations in the priority memory during training, we find that memory size and rollout length can have a significant impact on the distribution of trajectory priorities and, hence, on the performance of the algorithm.

研究の動機と目的

  • 通常、データ利用効率が低く、大量のデータを必要とするオンポリシー深層強化学習におけるサンプル効率の向上。
  • 報酬が疎な環境における均一な経験リプレイの非効率性を解消し、学習の潜在的価値がより高い軌道を優先順位付けする。
  • ポリシー更新の安定性を損なわずに、オンポリシーPPOにオフポリシー再現メカニズムを統合する。
  • 重要度サンプリングによる高分散を軽減する、オフポリシーPPO学習に適した堅牢な損失関数の開発。
  • メモリサイズとロールアウト長が軌道優先順位分布およびアルゴリズム性能に与える影響の調査。

提案手法

  • 3つの軌道優先順位指標を定義:最大および平均GAEベースの優先順位、および正規化された割引なし累積報酬ベースの優先順位。
  • 和木(sumtree)ベースの優先順位メモリに軌道を格納し、効率的な優先順位付きサンプリングを可能にする。
  • オフポリシー更新における分散を低減するための切り捨てられた重要度重み推定法を提案、特にマルチステップ経験において有効。
  • オフポリシー設定における安定的なポリシー改善を実現するため、切り捨てられた重要度重みを組み込んだ修正されたPPO損失関数を設計。
  • ランナーアクターアーキテクチャを採用し、アクターが軌道を生成し、優先順位を計算し、優先順位メモリに格納する。一方、ランナーはサンプルされた軌道を用いてポリシーを更新する。
  • ヒートマップを用いた軌道優先順位のダイナミクス分析により、メモリサイズとロールアウト長が優先順位分布および学習効率に与える影響を検証。

実験結果

リサーチクエスチョン

  • RQ1優先順位付き軌道リプレイは、オンポリシーPPO学習におけるサンプル効率をどのように向上させるか?
  • RQ2オンポリシーDRLにおけるリプレイを導くために、最も効果的な軌道優先順位指標は何か?
  • RQ3優先順位付きリプレイを用いる場合、切り捨てられた重要度重みはオフポリシーPPO更新における分散を効果的に低減できるか?
  • RQ4メモリサイズやロールアウト長などのハイパーパrameterは、軌道優先順位の分布および全体的な学習パフォーマンスにどのように影響するか?
  • RQ5優先順位付きリプレイを用いたハイブリッドオンポリシー/オフポリシー手法は、標準的なアタリベンチマークで最先端のパフォーマンスを達成できるか?

主な発見

  • PTR-PPOは、アタリの離散制御タスクのセットにおいて最先端のパフォーマンスを達成し、標準PPOおよび既存のオフポリシー基準を上回る。
  • GAEベースおよび報酬ベースの軌道優先順位を用いることで、学習速度と最終的なパフォーマンスが向上し、特にメモリサイズ256で最良の結果が得られた。
  • ヒートマップ分析により、メモリサイズが優先順位の差別化に顕著な影響を与えることが判明した。メモリサイズ256は最適な優先順位の多様性とパフォーマンスをもたらし、32などの小さなサイズでは少数の軌道が過剰にサンプリングされる傾向がある。
  • ロールアウト長は学習ダイナミクスに強い影響を及ぼす。ロールアウト長8が最良のパフォーマンスを達成し、16が2番目で、4が最悪だった。これは、優先順位の差別化が不十分だったためである。
  • 軌道優先順位の分布は時間とともに変化し、ヒートマップには明確な区別点(例:上昇期と平坦期)が現れ、優先順位のダイナミクスが学習進行を反映していることが示された。
  • ロールアウト長8のとき、報酬ベースの優先順位指標が最も良好な優先順位差別化を示し、この設定が軌道の重要性と多様性を最適にバランスさせていることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。