Skip to main content
QUICK REVIEW

[論文レビュー] VIREL: A Variational Inference Framework for Reinforcement Learning

Matthew Fellows, Anuj Mahajan|arXiv (Cornell University)|Nov 3, 2018
Reinforcement Learning in Robotics参考文献 77被引用数 12
ひとこと要約

本稿では、強化学習における変分推論フレームワークVIRELを提案する。このフレームワークは、方策最適化を期待値最大化問題として定式化し、価値関数と方策学習を別々に反復的に更新可能にする。モード探索型KLダイバージェンスとパラメータ化された行動価値関数を活用することで、決定論的な最適方策を学習し、高次元連続制御タスクにおいてSACなどの最先端手法を上回る性能を発揮する。

ABSTRACT

Applying probabilistic models to reinforcement learning (RL) enables the application of powerful optimisation tools such as variational inference to RL. However, existing inference frameworks and their algorithms pose significant challenges for learning optimal policies, e.g., the absence of mode capturing behaviour in pseudo-likelihood methods and difficulties learning deterministic policies in maximum entropy RL based approaches. We propose VIREL, a novel, theoretically grounded probabilistic inference framework for RL that utilises a parametrised action-value function to summarise future dynamics of the underlying MDP. This gives VIREL a mode-seeking form of KL divergence, the ability to learn deterministic optimal polices naturally from inference and the ability to optimise value functions and policies in separate, iterative steps. In applying variational expectation-maximisation to VIREL we thus show that the actor-critic algorithm can be reduced to expectation-maximisation, with policy improvement equivalent to an E-step and policy evaluation to an M-step. We then derive a family of actor-critic methods from VIREL, including a scheme for adaptive exploration. Finally, we demonstrate that actor-critic algorithms from this family outperform state-of-the-art methods based on soft value functions in several domains.

研究の動機と目的

  • 従来のRL推論フレームワークの限界、例えば擬似尤度法におけるモードの捕捉不良や、最大エントロピーRLにおける決定論的方策との不適合性を解消すること。
  • 行動価値関数の不確実性を統合して探索を誘導しつつ、決定論的方策学習をサポートする理論的裏付けのあるフレームワークを提供すること。
  • 価値関数および方策ネットワークにおける関数近似を形式的に統合し、近似のもとでの収束解析を保証すること。
  • アクタクリティック手法を1つの変分EMフレームワークに統一し、方策改善をEステップ、方策評価をMステップに対応させること。
  • 探索と活用のバランスを適応的に制御する実用的アルゴリズムを開発し、複雑な環境における性能を向上させること。

提案手法

  • VIRELは、将来のダイナミクスを要約するパラメータ化された行動価値関数 $\hat{Q}_{\omega}(h)$ を用いて、RL問題を確率的推論として定式化する。
  • Eステップが方策改善、Mステップが価値関数評価に対応する変分EMアルゴリズムを採用する。
  • モード探索型KLダイバージェンスを用いることで、方策が高報酬行動に集中するよう促進され、サンプル効率が向上する。
  • 再パラメータ化勾配を用いて方策および価値関数パラメータの解析的更新を導出し、深層ネットワークを用いたエンドツーエンド学習を可能にする。
  • virelおよびbetaの2つのアルゴリズムが導出され、後者は推定された分散 $\varepsilon_{\omega}$ を用いた適応的エントロピースケーリングを導入する。
  • 方策と価値関数最適化を分離することで、$\bar{\phi}$ を用いたターゲットネットワークスムージングを伴う別々の反復的更新が可能になる。

実験結果

リサーチクエスチョン

  • RQ1変分推論フレームワークとしてのVIRELは、原理的EMフレームワークにアクタクリティカル手法を統一しつつ、決定論的方策学習をサポートできるか?
  • RQ2モード探索型KLダイバージェンスの使用は、標準的なエントロピー正則化と比較して、どのように方策最適化を改善するか?
  • RQ3価値関数および方策ネットワークにおける関数近似を、収束保証のもとで形式的に推論フレームワークに統合できる範囲はどの程度か?
  • RQ4提案されたフレームワークは、高次元連続制御タスクにおいてSACなどの最先端手法を上回ることができるか?
  • RQ5行動価値関数の不確実性に基づく適応的探索は、サンプル効率および最終的な性能にどのように影響を与えるか?

主な発見

  • VIRELは、複雑で高次元なMuJoCo環境、特に連続的行動空間を有するタスクにおいて、ソフトアクタクリティカル(SAC)およびDDPGを上回る性能を発揮する。
  • フレームワークは、温度パrameterに基づくエントロピー正則化を必要とせず、自然に変分推論を通じて決定論的最適方策を学習する。
  • アルゴリズムのbetaバージョンは、Q関数誤差の分散を推定することで探索を適応的に制御し、サンプル効率が向上する。
  • 単純な低次元タスクでは、VIRELはSACおよびDDPGと同等の性能を示すが、複雑な環境では性能差が顕著に広がる。
  • 理論的解析により、方策改善と価値関数更新がEMアルゴリズムのEステップとMステップに正確に対応しており、統一された最適化フレームワークが得られることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。