Skip to main content
QUICK REVIEW

[論文レビュー] Making Sense of Reinforcement Learning and Probabilistic Inference

Brendan O’Donoghue, Ian Osband|arXiv (Cornell University)|Jan 3, 2020
Reinforcement Learning in Robotics参考文献 46被引用数 12
ひとこと要約

この論文は、人気のある「強化学習を推論として扱う」枠組みに深刻な欠陥が存在することを特定している:エピステミックな不確実性を無視しているため、単純な問題ですら探索が不十分になり、性能が劣る。著者らは、K学習に相当する修正された推論枠組みを提案し、不確実性を適切に扱うことで、証明可能な効率的探索が可能となり、表計算およびディープRLの両設定で標準的手法(ソフトQ学習)を上回ることを示している。

ABSTRACT

Reinforcement learning (RL) combines a control problem with statistical estimation: The system dynamics are not known to the agent, but can be learned through experience. A recent line of research casts `RL as inference' and suggests a particular framework to generalize the RL problem as probabilistic inference. Our paper surfaces a key shortcoming in that approach, and clarifies the sense in which RL can be coherently cast as an inference problem. In particular, an RL agent must consider the effects of its actions upon future rewards and observations: The exploration-exploitation tradeoff. In all but the most simple settings, the resulting inference is computationally intractable so that practical RL algorithms must resort to approximation. We demonstrate that the popular `RL as inference' approximation can perform poorly in even very basic problems. However, we show that with a small modification the framework does yield algorithms that can provably perform well, and we show that the resulting algorithm is equivalent to the recently proposed K-learning, which we further connect with Thompson sampling.

研究の動機と目的

  • 単純な意思決定問題において、探索が不十分になる原因となる『強化学習を推論として扱う』枠組みの根本的欠陥を特定すること。
  • 将来の行動と観測の推論を含めることで、強化学習を確率的推論として正しく定式化する方法を明確にすること。
  • 元のベイズ最適解が制御と推論の両方を内蔵しているが、計算的に非効率であることを示すこと。
  • エピステミックな不確実性を組み込むことで、より良い探索が可能となる『RL as inference』枠組みの原理的修正を提案すること。
  • 実験的に、修正された枠組み(K学習)が問題のサイズに応じて滑らかにスケーリングすることを示すこと。

提案手法

  • 将来の行動と観測に関するベイジアン推論問題としてRL問題を再定式化し、モデルにエピステミックな不確実性を組み込む。
  • 確率的グラフィカルモデル(PGM)を用いて、指数関数的報酬を伴うMDPを表現し、方策を潜在変数として扱う。
  • 情報の価値を考慮した修正された推論目的関数を導入し、探索が不確実性によって駆動されることを保証する。
  • 後方分布のサンプリングを用いてQ値の後方分布を近似することで、K学習をこの修正された推論枠組みに対する原理的近似として導出する。
  • ディープRLにおける後方分布の近似のために、アンサンブル法とランダム化された事前分布関数を用いて実装する。
  • 表計算およびディープRLのベンチマークで性能を評価し、特にDeepSea MDPにおいて、レグレットと学習時間を指標として用いる。

実験結果

リサーチクエスチョン

  • RQ1理論的有用性があるにもかかわらず、なぜ標準的な『強化学習を推論として扱う』枠組みが単純な意思決定問題で失敗するのか?
  • RQ2強化学習と確率的推論の関係を、エピステミックな不確実性を含めて正しく形式化するにはどうすればよいか?
  • RQ3『RL as inference』枠組みにどのような修正を加えると、証明可能な効率的探索が得られるか?
  • RQ4サンプル効率の観点から、得られたアルゴリズムはトムソンサンプリングおよびソフトQ学習と比べてどうなるか?
  • RQ5修正された推論枠組みの知見は、関数近似を伴うディープRLにスケーリング可能か?

主な発見

  • 標準的な『強化学習を推論として扱う』枠組みは、エピステミックな不確実性を無視しているため、単純な問題ですら探索が不十分になり、問題のサイズに応じて指数関数的にレグレットが増大する。
  • この欠陥に基づくフレームワークから導出されたソフトQ学習は、問題のサイズに応じて滑らかにスケーリングせず、DeepSea MDPでは最適方策を学習するのに指数関数的時間が必要となる。
  • 不確実性を適切に扱う修正版のK学習は、問題のサイズに応じて多項式的にスケーリングされ、ほぼ最適な学習時間に到達する。
  • トムソンサンプリングとK学習の両方が、表計算およびディープRLの両設定で滑らかにスケーリングするが、ソフトQ学習は探索を重視するタスクで失敗する。
  • 一括ピクセル入力のDeepSea環境において、ニューラルネットワークアンサンブルとランダム化された事前分布を用いたK学習のディープRL実装は、深く効果的な探索を実現した。
  • 結果から、推論枠組みにエピステミックな不確実性を組み込むことは、効率的探索のための不可欠な要素であり、K学習はこの課題に対する原理的解決策を提供することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。