Skip to main content
QUICK REVIEW

[論文レビュー] Policy Gradient Methods for Off-policy Control

Lucas Lehnert, Doina Precup|arXiv (Cornell University)|Dec 13, 2015
Reinforcement Learning in Robotics参考文献 6被引用数 5
ひとこと要約

この論文は、行動方策の適応的特性によって引き起こされる分布のずれを是正するため、ポリシー勾配をGQフレームワークに統合した、新しい勾配ベースのオフポリシー強化学習アルゴリズムであるポリシー勾配Q学習(PGQ)を提案する。PGQは、定常分布をポリシーパラメータに依存するものとしてモデル化することで、同時にポリシーの改善と評価を実行し、制御問題における収束を保証する。オフポリシー設定、特にBairdの反例において、Q学習やGQを上回る性能を発揮する。

ABSTRACT

Off-policy learning refers to the problem of learning the value function of a way of behaving, or policy, while following a different policy. Gradient-based off-policy learning algorithms, such as GTD and TDC/GQ, converge even when using function approximation and incremental updates. However, they have been developed for the case of a fixed behavior policy. In control problems, one would like to adapt the behavior policy over time to become more greedy with respect to the existing value function. In this paper, we present the first gradient-based learning algorithms for this problem, which rely on the framework of policy gradient in order to modify the behavior policy. We present derivations of the algorithms, a convergence theorem, and empirical evidence showing that they compare favorably to existing approaches.

研究の動機と目的

  • 行動方策が非定常的で分布のずれを引き起こすオフポリシー制御のための収束する勾配ベースのアルゴリズムが不足している問題に対処すること。
  • GQ や TDC などのオフポリシー価値関数学習手法を制御設定に拡張するために、ポリシー勾配補正を組み込むこと。
  • ポリシーパラメータの関数として定常分布をモデル化することで、オフポリシー制御における安定な学習を可能にすること。
  • 関数近似を用いた勾配ベースのオフポリシー制御に対して理論的収束保証を提供すること。
  • Bairdの反例のような挑戦的なオフポリシー環境において、手法を実験的に検証すること。

提案手法

  • 定常分布 $d_{s,a}$ をポリシーパラメータ $\theta$ に依存する形で明示的にモデル化する修正された平均二乗投影ベルヌーイ誤差(MSPBE)目的関数を提案。$d_{s,a} = d_s \pi_\theta(a|s)$ を通じて表現される。
  • ベルヌーイ作用素と定常分布の両方が $\theta$ にパrametric依存するのを考慮し、MSPBE目的関数の勾配を導出。これによりポリシー勾配項が導入される。
  • 値関数パラメータ $\theta$ に対する新しい更新則を導入。$\rho^\nabla \delta (\phi^\top w)$ に比例する補正項を含む。ここで $\rho^\nabla$ はポリシー勾配が分布に与える影響を捉える。
  • 2つの時間スケールの更新を採用:$\theta$ は学習率 $\alpha$ で更新され、重みベクトル $w$(投影ベルヌーイ誤差用)は学習率 $\beta$ で更新され、安定性が保証される。
  • 探索のためのボルツマン方策を採用。行動選択確率は $\pi_\theta(a|s) = \exp(\theta^\top \phi(s,a)/\tau)/\sum_b \exp(\theta^\top \phi(s,b)/\tau)$ で与えられる。
  • サンプリングされた遷移またはシミュレートされた軌道を用いて、オンポリシーおよびオフポリシーの更新を実行。MSPBE と MSTDE を評価指標として用いる。

実験結果

リサーチクエスチョン

  • RQ1非定常的行動方策を伴う制御問題に、収束性を保つ勾配ベースのオフポリシーアルゴリズムを拡張できるか?
  • RQ2GQ/TDCフレームワークにポリシー勾配項を統合することで、オフポリシー学習における分布のずれを是正できるか?
  • RQ3提案されたPGQアルゴリズムは、Bairdの反例のような挑戦的なオフポリシー環境でもMSPBEがゼロに収束するか?
  • RQ4オフポリシー採択条件下で、Q学習やGQと比較してPGQの安定性と収束速度はどのように異なるか?
  • RQ5オフポリシー価値関数学習において、ポリシーパラメータに依存する定常分布の影響は何か?

主な発見

  • Bairdの反例において、PGQはMSPBEがゼロに収束するが、Q学習は同じ条件下で単調に発散する。
  • サンプリングおよび軌道ベースの両方の実験において、PGQは安定した収束を達成し、Q学習を上回り、GQと同等の収束速度と精度を達成する。
  • 価値関数更新にポリシー勾配補正を組み込むことで、ポリシー適応に起因する分布のずれを効果的に是正する。
  • 実験的結果から、PGQは繰り返し実行において低MSPBEおよび低MSTDEを維持しており、ロバストで安定した学習を示す。
  • ボルツマン探索方策を用いたオフポリシー設定でも、行動方策とターゲット方策が異なる場合でさえ、PGQは収束を示す。
  • 理論的分析により、勾配導出が定常分布の $\theta$ へのパrametric依存性を適切に考慮しており、制御問題における安定な学習が可能であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。