Skip to main content
QUICK REVIEW

[論文レビュー] Quinoa: a Q-function You Infer Normalized Over Actions

Jonas Degrave, Abbas Abdolmaleki|arXiv (Cornell University)|Nov 5, 2019
Control Systems and Identification参考文献 15被引用数 4
ひとこと要約

Quinoaは、正規化フローを用いたポリシーで柔らかくQ関数を学習する、新しいオペレーター・クリティカル強化学習アルゴリズムを提案する。これにより、別個のポリシー最適化を必要とせず、閉形式の最適ポリシー推定が可能になる。正規化フローを用いることで、複雑で多次元な行動分布をモデル化でき、学習を簡素化し、最先端の手法と同等の性能を達成しながら、連続制御タスクにおける豊かな非ガウス型の探索を可能にする。

ABSTRACT

We present an algorithm for learning an approximate action-value soft Q-function in the relative entropy regularised reinforcement learning setting, for which an optimal improved policy can be recovered in closed form. We use recent advances in normalising flows for parametrising the policy together with a learned value-function; and show how this combination can be used to implicitly represent Q-values of an arbitrary policy in continuous action space. Using simple temporal difference learning on the Q-values then leads to a unified objective for policy and value learning. We show how this approach considerably simplifies standard Actor-Critic off-policy algorithms, removing the need for a policy optimisation step. We perform experiments on a range of established reinforcement learning benchmarks, demonstrating that our approach allows for complex, multimodal policy distributions in continuous action spaces, while keeping the process of sampling from the policy both fast and exact.

研究の動機と目的

  • オフポリシーのオペレーター・クリティカルアルゴリズムにおける別個のポリシー最適化ステップの必要性を排除すること。
  • 連続的行動空間における複雑で多次元的なポリシーからの正確かつ高速なサンプリングを可能にすること。
  • 時系列差分学習を用いて価値関数とポリシーを同時に最適化する統一された学習目的を開発すること。
  • 正規化フローを用いて任意で表現力のあるポリシー分布をサポートしつつ、閉形式の最適ポリシー推定を維持すること。
  • 連続制御ベンチマークにおいて、ポリシーの表現力と学習の安定性の向上を示すこと。

提案手法

  • 相対エントロピー正則化RL目的関数を用いて、閉形式の最適ポリシー導出を可能にするソフトQ関数を定義する。
  • 状態に条件付けられた正規化フロー(特にReal NVP)をポリシーにパラメータ化することで、ユニバーサル密度推定を実現する。
  • リプレイバッファの遷移に対して時系列差分誤差の二乗を最小化することで、ソフトQ関数を時系列差分学習により学習する。
  • 最適ポリシーは行動の上でのソフトQ関数の正規化によって得られ、反復的ポリシー最適化の必要性がなくなる。
  • 価値関数とポリシーはターゲットネットワークと勾配クリッピングを用いて同時に学習され、学習の安定化が図られる。
  • 本手法は、非ガウス的で多次元的かつ非対称な行動分布をサポートしつつ、ポリシーからの正確で効率的なサンプリングを可能にする。

実験結果

リサーチクエスチョン

  • RQ1反復的最適化を必要とせず、閉形式で最適ポリシーが得られるようなソフトQ関数を学習可能か?
  • RQ2正規化フローを用いることで、連続制御における表現力があり多次元的なポリシーを実現できるか? また、効率的なサンプリングと学習を維持できるか?
  • RQ3ポリシー最適化ステップを排除することで、連続制御ベンチマークにおける学習の安定性と性能が向上するか?
  • RQ4SVG(0)のような最先端のアルゴリズムと同等の性能を達成できるか? また、より豊かなポリシー分布をサポートできるか?
  • RQ5学習されたポリシーは、標準的なガウス型ポリシーと比較して、構造的(例:多次元的、非ガウス的)にどのように異なるか?

主な発見

  • QuinoaはDeepMind Control SuiteのCheetahおよびWalkerタスクにおいてSVG(0)と同等の性能を達成するが、Hopperタスクではわずかに低い性能を示す。
  • Quinoaが学習したポリシーは非ガウス的特性を示しており、高い歪度、非線形相関を持つノイズ、および行動空間における有限サポートを有する。
  • 一部の状態(例:Walker環境)では、ポリシーが行動空間の複数のコーナーを探索するという多次元的行動を示す。
  • 学習中に一部の行動次元が崩壊する一方で、他の次元はエントロピーと探索性を維持するために高い分散を保つ。
  • 正規化フローの可逆性のおかげで、複雑な分布であってもポリシーからの正確かつ高速なサンプリングが可能である。
  • 閉形式のポリシー推定により、別個のポリシー最適化の必要性がなくなり、学習パイプラインが簡素化される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。