Skip to main content
QUICK REVIEW

[論文レビュー] A short variational proof of equivalence between policy gradients and soft Q learning

Pierre H. Richemond, Brendan Maginnis|arXiv (Cornell University)|Dec 22, 2017
Reinforcement Learning in Robotics参考文献 12被引用数 3
ひとこと要約

本稿では、凸双対性、特にギブズ/ドンスカー=ヴァラドハンの公式を用いて、ソフトQ学習とソフトマックス方策勾配の等価性を簡潔な変分的証明で提示する。エントロピー正則化とソフトマックス緩和は双対的視点として同一視され、よりスムーズな導出を可能にするとともに、最適方策からのKLダイバージェンスを用いた最適性ギャップの新たな方策不等式を導入する。

ABSTRACT

Two main families of reinforcement learning algorithms, Q-learning and policy gradients, have recently been proven to be equivalent when using a softmax relaxation on one part, and an entropic regularization on the other. We relate this result to the well-known convex duality of Shannon entropy and the softmax function. Such a result is also known as the Donsker-Varadhan formula. This provides a short proof of the equivalence. We then interpret this duality further, and use ideas of convex analysis to prove a new policy inequality relative to soft Q-learning.

研究の動機と目的

  • 凸双対性を用いて、ソフトQ学習とソフトマックス方策勾配の等価性を、より短く洞察に富んだ証明で提示すること。
  • エントロピー正則化とソフトマックス緩和が、これらの2つのRLフレームワークを統合する上で果たす根本的役割を明確にすること。
  • 最適方策からのKLダイバージェンスを用いて最適性ギャップをバインドする、新たな方策不等式を導出すること。
  • 理論的等価性を凸解析および大偏差理論の既存結果と結びつけること。
  • 将来の研究の基盤を築くこと。具体的には、凸最適化アルゴリズムと強化学習手法の間の双対性についての考察を提供すること。

提案手法

  • 自由エネルギー関数をエントロピー関数の凸共役として表現するため、ギブズの変分原理を用いる。
  • 最適方策価値をギブズ測度下での報酬の対数パーティション関数として表すために、ドンスカー=ヴァラドハンの公式を適用する。
  • 1ステップバンディット設定において、レジェンドル=フェンケル双対性を用いて、ソフトQ学習と方策勾配の等価性を導出する。
  • 期待報酬ギャップと方策間のKLダイバージェンスを関連付ける輸送不等式を導入する。
  • 凸関数の逆レジェンドル変換を用いた一般不等式を導出し、報酬差をKLダイバージェンスと結びつける。
  • パラメータ化されたソフトマックス方策にこの双対性フレームワークを適用し、最適方策からのKLダイバージェンスが、その方策下での期待Q値と期待報酬の差に比例することを示す。

実験結果

リサーチクエスチョン

  • RQ1凸双対性をどのように用いることで、ソフトQ学習と方策勾配の等価性に対する、より短く洞察に富んだ証明を得られるか?
  • RQ2強化学習の文脈において、エントロピー正則化とソフトマックス緩和の正確な数学的関係は何か?
  • RQ3最適方策からのKLダイバージェンスを用いて最適性ギャップをバインドする、新たな方策不等式を導出可能か?
  • RQ4ドンスカー=ヴァラドハンの変分公式は、RLにおけるエントロピーと期待値の取り扱いをどのように統一するか?
  • RQ5この双対性は、分散低減技術やRLにおける新しい最適化アルゴリズムの設計にどのような意味を持つのか?

主な発見

  • ギブズの変分原理と凸双対性を用いて、ソフトQ学習とソフトマックス方策勾配の等価性が、先行研究よりも著しく短い証明で厳密に確立された。
  • ドンスカー=ヴァラドハンの公式により、自由エネルギー関数の変分的表現が得られ、バンディット設定における等価性の直接的導出が可能になった。
  • 新たな方策不等式が導出された:任意の方策と最適方策との間の期待報酬ギャップは、最適方策からのKLダイバージェンスに適用された凸関数の逆レジェンドル変換によってバインドされる。
  • 最適方策とパラメータ化された方策との間のKLダイバージェンスが、その方策下での期待Q値と期待報酬の差に比例することが示された。
  • フレームワークにより、実用的には異なるソフトマックス温度を用いることが可能となり、経験的モーメント生成関数を用いたバインドの柔軟な推定が可能になった。
  • 結果から、凸最適化、大偏差理論、強化学習の間には深い接点があることが示唆され、モンテカルロ推定量におけるサンプル効率の向上や分散低減のための新たな道筋が開かれた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。