Skip to main content
QUICK REVIEW

[論文レビュー] Thompson Sampling is Asymptotically Optimal in General Environments

Jan Leike, Tor Lattimore|arXiv (Cornell University)|Feb 25, 2016
Advanced Bandit Algorithms Research参考文献 15被引用数 18
ひとこと要約

この論文は、一般の確率的環境において、マルコフ性、エルゴード性、完全観測性の仮定を必要とせずに、トムソンサンプリングが平均的最適性と非線形のリグレットを達成することを確立している。可算個の環境クラスの事後分布からサンプリングし、前方視野の時間枠内で最適に行動することで、この手法は最適性能に収束し、回復可能性条件のもとでリグレットが消える。

ABSTRACT

We discuss a variant of Thompson sampling for nonparametric reinforcement learning in a countable classes of general stochastic environments. These environments can be non-Markov, non-ergodic, and partially observable. We show that Thompson sampling learns the environment class in the sense that (1) asymptotically its value converges to the optimal value in mean and (2) given a recoverability assumption regret is sublinear.

研究の動機と目的

  • 一般の非マルコフ的・非エルゴード的・部分的に観測可能な確率的環境において、トムソンサンプリングの漸近的最適性と非線形リグレットを確立すること。
  • ベイジアンエージェントの一般RLにおける限界を克服し、トムソンサンプリングが事前分布のバイアスを回避し、客観的最適性を達成することを示すこと。
  • エルゴード性や事後分布の性質に関する強い仮定なしに、非パラメトリックで可算な環境クラスにおけるトムソンサンプリングの理論的保証を提供すること。
  • 一般強化学習フレームワークにおいて、ベイジアン探索と頻度主義のリグレットバインディングを調和させること。
  • トムソンサンプリングが、やや弱い回復可能性仮定のもとで、平均的最適性を達成し、非線形リグレットを達成できることを示すこと。

提案手法

  • トムソンサンプリングは、可算個の確率的環境クラスの事後分布から環境モデル ρ を選択する。
  • 各サンプルされた環境 ρ に対して、割引関数の質量の大部分をカバーする前方視野の時間枠内で、ρ-最適方策に従う。
  • 各時刻で事後分布から再サンプリングし、現在の有効な前方視野に対して最適に行動することで、方策を更新する。
  • 分析は、エージェントが悪い状態から脱出し、最終的に最適なパフォーマンスに回復できるように保証する回復可能性仮定に依存する。
  • ベイジアン更新と、真の環境と区別できない環境に事後分布が集中することを用いて理論的結果を導出する。
  • リグレットバインディングは、カップリングの手法と、特定の可積分性および減衰条件を満たす割引関数の使用によって確立される。

実験結果

リサーチクエスチョン

  • RQ1マルコフ性やエルゴード性の仮定なしに、一般の確率的環境において、トムソンサンプリングが平均的最適性を達成できるか?
  • RQ2回復可能性条件のもとで、一般環境においてトムソンサンプリングが非線形リグレットを達成できるか?
  • RQ3事前分布が誤っている場合、トムソンサンプリングはベイズ最適エージェントと比較して、リグレットと収束性においてどのように異なるか?
  • RQ4探索メカニズムを通じて、トムソンサンプリングはオフポリシー予測や情報量の増加を達成できるか?
  • RQ5考察された一般設定において、トムソンサンプリングは弱く漸近的に最適であるか?

主な発見

  • トムソンサンプリングは平均的最適性を漸近的に達成する:方策の割引価値は、クラスに属するすべての環境に対して最適値に収束する。
  • 回復可能性仮定のもとで、トムソンサンプリングの最悪ケースリグレットは非線形である。すなわち、トムソンサンプリング方策 πₜ に対して Rₘ(πₜ, μ) ∈ o(m) が成り立つ。
  • 収束は確率的であり、事後分布の性質やエルゴード性に関する強い仮定は必要としない。
  • 非線形リグレットバインディングは、このような一般環境(非マルコフ的かつ部分的に観測可能な設定を含む)において、トムソンサンプリングに対して初めて確立されたものである。
  • トムソンサンプリングの探索は、情報最大化を目的とせず、報酬指向的である。これは、ベイズ・エクスプローラン(Bayes-Exp)とは探索戦略が異なる。
  • 強い事前バイアスがあるにもかかわらず、事前分布が混合ベイジアン環境 ξ に高い確率を割り当てている場合、トムソンサンプリングはベイジアン混合 ξ においてほぼ最適なパフォーマンスを達成できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。