Skip to main content
QUICK REVIEW

[論文レビュー] Is the Policy Gradient a Gradient?

Chris Nota, Philip S. Thomas|arXiv (Cornell University)|Jun 17, 2019
Reinforcement Learning in Robotics参考文献 29被引用数 6
ひとこと要約

この論文は、PPO や SAC、TD3 といった最先端のアルゴリズムを含む大多数のポリシー勾配法が、割引率の取り扱いが誤っているために、いかなる目的関数の勾配に従わないことを証明している。著者らは、これらの手法が真の勾配でない方向を最適化しており、収束しないか、最悪の固定点に収束することを示し、高い引用数を誇る論文にもかかわらず、学術文献において広範にわたる理論的誤りを暴露している。

ABSTRACT

The policy gradient theorem describes the gradient of the expected discounted return with respect to an agent's policy parameters. However, most policy gradient methods drop the discount factor from the state distribution and therefore do not optimize the discounted objective. What do they optimize instead? This has been an open question for several years, and this lack of theoretical clarity has lead to an abundance of misstatements in the literature. We answer this question by proving that the update direction approximated by most methods is not the gradient of any function. Further, we argue that algorithms that follow this direction are not guaranteed to converge to a "reasonable" fixed point by constructing a counterexample wherein the fixed point is globally pessimal with respect to both the discounted and undiscounted objectives. We motivate this work by surveying the literature and showing that there remains a widespread misunderstanding regarding discounted policy gradient methods, with errors present even in highly-cited papers published at top conferences.

研究の動機と目的

  • 現代のポリシー勾配法が有効な目的関数を最適化するかどうかという長年の未解決問題を解消すること。
  • トップカンferの国際会議で発表された高引用論文を含め、学術文献に広がる理論的誤りを暴露すること。
  • ほとんどのポリシー勾配アルゴリズムで用いられる更新方向が、いかなる関数の勾配でもないことを示すこと。
  • これらのアルゴリズムの固定点が、割引ありおよび割引なしの両方の目的関数に関して、グローバルに最悪である可能性があることを示すこと。
  • ポリシー勾配法の理論的基盤を明確にし、強化学習コミュニティ内の誤解を是正すること。

提案手法

  • 数学的に、多くのポリシー勾配法における更新方向が、割引率の取り扱いが誤っているために、いかなる目的関数の勾配でもないことを証明する。
  • ポリシー勾配定理を分析し、状態分布における割引率の1つのインスタンスを無視した誤りを特定する。
  • 固定点が割引ありおよび割引なしの両方の報酬に対してグローバルに最悪となる反例を構築する。
  • stable-baselines ライブラリに含まれる8つのトップクラスのRLアルゴリズム(例:PPO、SAC、TD3、A2C/A3C)をレビューし、誤った勾配定式化が用いられていることを確認する。
  • 理論的分析と実証的レビューを用いて、8つの論文のうち唯一1つだけが真のポリシー勾配からの逸脱を認識していたことを示す。
  • 文献における誤解を生じさせている原因は、参考となる目的関数を明示しないまま「不偏推定器」と主張するような、曖昧な表現にあると主張する。

実験結果

リサーチクエスチョン

  • RQ1現代のポリシー勾配法で用いられる更新方向が、いかなる目的関数の勾配であるか?
  • RQ2PPO や SAC といった最先端のポリシー勾配アルゴリズムが実際に最適化する目的関数は何か、もしあるなら?
  • RQ3これらのアルゴリズムの固定点が、割引ありおよび割引なしの両方の報酬に関して、グローバルに最悪である可能性はあるか?
  • RQ4なぜ広く引用されている強化学習論文が、その勾配推定器の不偏性について誤った主張を繰り返し行っているのか?
  • RQ5状態分布における割引率の誤った取り扱いが、ポリシー勾配法の収束性および最適性にどのように影響するか?

主な発見

  • PPO や SAC、TD3、A2C/A3C を含む大多数のポリシー勾配法は、状態分布の定式化が誤っているために、いかなる目的関数の勾配にも従わない。
  • これらのアルゴリズムで用いられる更新方向は、いかなる関数の勾配でもないため、最適ポリシーへの収束を主張する根拠が失われる。
  • 固定点が割引ありおよび割引なしの両方の報酬目的関数に対してグローバルに最悪となる反例が構築された。
  • レビューした8つの高引用論文のうち、唯一1つだけが真のポリシー勾配からの逸脱を認識しており、他の論文は不正確または誤った不偏推定に関する主張をしていた。
  • 混乱の原因は、参考となる目的関数を明示しないまま「不偏」と主張するような曖昧な表現に起因しており、これが広範な誤解を生じさせている。
  • 分析により、多くの最先端の深層強化学習アルゴリズムに根本的な理論的欠陥が存在することが判明し、それらの理論的根拠が揺るがされている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。