Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Off-Policy Actor-Critic

Shangtong Zhang, Wendelin Boehmer|arXiv (Cornell University)|Mar 27, 2019
Reinforcement Learning in Robotics参考文献 49被引用数 7
ひとこと要約

この論文は、オフポリシー方策勾配強化学習の統一的枠組みを提供する反事後的目的を導入し、従来の手法よりも目標方針の性能をよりよく予測する。一般化オフポリシー方策勾配定理を導出し、不偏勾配推定のための強調的アプローチを用いることで、著者たちは、深層強化学習ベンチマークで最初の実験的成功を収めたエムフィック・パック(Geoff-PAC)を開発した。この手法は、Mujocoロボットタスクにおいて、先行するオフポリシー・アクタクリティック手法を上回った。

ABSTRACT

We propose a new objective, the counterfactual objective, unifying existing objectives for off-policy policy gradient algorithms in the continuing reinforcement learning (RL) setting. Compared to the commonly used excursion objective, which can be misleading about the performance of the target policy when deployed, our new objective better predicts such performance. We prove the Generalized Off-Policy Policy Gradient Theorem to compute the policy gradient of the counterfactual objective and use an emphatic approach to get an unbiased sample from this policy gradient, yielding the Generalized Off-Policy Actor-Critic (Geoff-PAC) algorithm. We demonstrate the merits of Geoff-PAC over existing algorithms in Mujoco robot simulation tasks, the first empirical success of emphatic algorithms in prevailing deep RL benchmarks.

研究の動機と目的

  • オフポリシー強化学習における「エク cursion 目的」の誤解を招く性質に取り組む。これは、行動方針の定常分布における目標方針の性能を測るのではなく、目標方針自身の分布における性能を測るものである。
  • 制御可能なパラメータ γ̂ を用いて、エクурсィオン目的と代替ライフ目的(真のデプロイメント性能)を統一する新しい目的、すなわち反事後的目的を提案する。
  • 一般化オフポリシー方策勾配定理を証明し、反事後的目的の不偏勾配推定を可能にする。
  • 反事後的目的の不偏サンプル勾配を提供する、強調的アプローチに基づくアクタクリティックアルゴリズムであるGeoff-PACを開発する。
  • 困難な深層強化学習環境におけるGeoff-PACの実験的妥当性を検証し、既存のオフポリシーアルゴリズムを上回る優れた性能を示す。

提案手法

  • 反事後的目的を、γ̂ = 0 の場合にエクурсィオン目的、γ̂ = 1 の場合に代替ライフ目的に連続的に内挿する形で提案。行動方針の定常分布を用いて、目標方針下での仮想的エクスカージョンを評価する。
  • 一般化オフポリシー方策勾配定理(GOPPG定理)を導出。これは、目標方針と行動方針の密度比を微分することで、反事後的目的の方策勾配を計算するものである。
  • Suttonら(2016)の強調的アプローチを用い、不偏な勾配サンプルを計算し、弱い仮定のもとで極限での収束を保証する。
  • 関数近似とオフポリシー時系列差分学習を組み合わせた、反事後的目的を用いた深層強化学習アルゴリズムとして、Geoff-PACを実装する。
  • 密度比を用いて遷移を再重み付けし、勾配推定値を反事後的目的と一致させる。これにより、従来の手法で見られる偏った「方策半勾配」更新を回避する。
  • パラメータ化された γ̂ を用いることで、目的におけるバイアス・バリアンスのトレードオフを可能にし、柔軟で頑健な方策最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1エクурсィオン目的と比較して、実デプロイメント時の目標方針性能をよりよく予測できる統一的目的を定義できるか?
  • RQ2この新しい目的の勾配を、オフポリシー学習と関数近似と整合的かつ一貫して計算できるか?
  • RQ3強調的アプローチを深層オフポリシー・アクタクリティックアルゴリズムに成功裏に適用でき、現代のベンチマークで実験的成功を収められるか?
  • RQ4調整可能な γ̂ パラメータを備えた提案された反事後的目的は、連続制御タスクにおけるサンプル効率と最終的性能を向上させるか?
  • RQ5Geoff-PACは、深層強化学習ベンチマークで強調的手法の最初の成功応用であり、既存のオフポリシー・アクタクリティック手法を上回るか?

主な発見

  • 反事後的目的は、エクурсィオン目的と代替ライフ目的を効果的に統合し、γ̂ = 1 の場合に真のデプロイメント性能の目的を回復する。
  • 一般化オフポリシー方策勾配定理は、オンポリシーのデータが存在しない状況でも、反事後的目的の勾配を理論的に妥当に計算する方法を提供する。
  • Geoff-PACは、深層強化学習ベンチマークで強調的アルゴリズムの最初の実験的成功を達成し、Mujocoロボットシミュレーションタスクにおいて、既存のオフポリシー・アクタクリティック手法を上回った。
  • エクурсィオン目的に基づく手法(Degrisら(2012)、Imaniら(2018))と比較して、サンプル効率と最終的性能の両方が向上した。
  • γ̂ の使用により柔軟なバイアス・バリアンスのトレードオフが可能であり、報酬形状の調整や価値関数の再重み付けを必要とせず、方策勾配フレームワークに留まる。
  • 実験結果から、Geoff-PACは複数のMujoco環境にわたり良好に一般化しており、複雑な制御設定における頑健性とスケーラビリティを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。