Skip to main content
QUICK REVIEW

[論文レビュー] Stable Policy Optimization via Off-Policy Divergence Regularization

Abdelaziz Touati, Amy Zhang|arXiv (Cornell University)|Mar 9, 2020
Reinforcement Learning in Robotics参考文献 30被引用数 8
ひとこと要約

この論文では、PPO-DICEを提案する。PPO-DICEは、オフポリシーで敵対的訓練を用いて、連続する方策の状態-行動訪問分布間の乖離を最小化することで、方策更新を正則化する安定な方策最適化手法である。本手法は、行動確率のクリッピングに依存せず、長期的な分布シフトを直接制約することにより、AtariおよびMuJoCoベンチマークにおいてPPOやTRPOよりも高いサンプル効率と最終的なパフォーマンスを達成する。

ABSTRACT

Trust Region Policy Optimization (TRPO) and Proximal Policy Optimization (PPO) are among the most successful policy gradient approaches in deep reinforcement learning (RL). While these methods achieve state-of-the-art performance across a wide range of challenging tasks, there is room for improvement in the stabilization of the policy learning and how the off-policy data are used. In this paper we revisit the theoretical foundations of these algorithms and propose a new algorithm which stabilizes the policy improvement through a proximity term that constrains the discounted state-action visitation distribution induced by consecutive policies to be close to one another. This proximity term, expressed in terms of the divergence between the visitation distributions, is learned in an off-policy and adversarial manner. We empirically show that our proposed method can have a beneficial effect on stability and improve final performance in benchmark high-dimensional control tasks.

研究の動機と目的

  • PPO や TRPO などの方策勾配法における不安定性とオフポリシーデータの非最適な再利用を解消すること。
  • 連続する方策間の長期的状態-行動訪問分布シフトを直接制約することにより、方策最適化の安定性を向上させること。
  • 訪問分布間の乖離を推定・正則化するために、オフポリシーで敵対的訓練を用いる手法を開発すること。
  • 直接的な訪問分布正則化が、より良い最終的パフォーマンスとサンプル効率をもたらすことを実証的に検証すること。
  • 行動確率のクリッピングが長期的分布シフトを制御するのに不十分であり、訪問分布制御がより効果的であることを示すこと。

提案手法

  • 連続する方策が誘発する状態-行動訪問分布間の乖離に基づく新しい正則化項を提案する。
  • 識別器ネットワークを用いて、敵対的訓練により訪問分布間の乖離をオフポリシーで推定する。
  • 乖離正則化をPPOのサrogate目的関数に統合し、大きな分布シフトをペナルティ化する新しい目的関数を構築する。
  • 二重最適化スキームを採用:方策は正則化された目的関数を最大化するように更新され、識別器は訪問分布乖離を正確に推定するように訓練される。
  • ハイパーパrameter λ を用いて方策目的関数と乖離正則化をバランスさせるが、訓練中に適応的に調整する。
  • PPOと同様に行動損失のクリッピングを追加の正則化として用い、さらに訓練の安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1状態-行動訪問分布乖離の直接的な正則化が、方策最適化の安定性と最終的パフォーマンスの向上に寄与するか?
  • RQ2オフポリシーで敵対的推定を用いた訪問分布乖離の推定は、深層強化学習において効果的かつスケーラブルか?
  • RQ3訪問分布乖離による長期的分布シフトの制御が、行動確率のクリッピングよりも優れたサンプル効率とパフォーマンスをもたらすか?
  • RQ4多様な高次元制御環境において、本手法はPPO や TRPO と比較してどのように差をつけるか?
  • RQ5実際の応用において最適なパフォーマンスを発揮するためのハイパーパrameter設定(例:識別器のステップ数、学習率)は何か?

主な発見

  • PPO-DICEは17のAtari環境のうち12でPPOを顕著に上回り、平均最終報酬において統計的に有意な改善を示した。
  • MuJoCoスイートにおいて、PPO-DICEはテストされた6つの最も困難な環境のうち5つで、PPO や TRPO よりも高い最終パフォーマンスを達成した。
  • 行動損失のクリッピングと適応的λスケジューリングを併用した手法は、クリッピングなしのバージョンで見られるパフォーマンスの崩壊を回避する優れた安定性を示した。
  • 方策更新ごとにK=5ステップの識別器最適化と、方策の学習率の10倍の識別器学習率を設定した場合、全環境で最良の全体的パフォーマンスが得られた。
  • 実験結果から、訪問分布乖離正則化が、行動確率制約に依存する場合よりも、より安定した学習とより優れた一般化性能をもたらすことが明らかになった。
  • アブレーションスタディにより、訪問分布正則化を用いても、行動損失のクリッピングが、分散に起因する方策劣化を防ぐために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。