Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Bandits with Context Distributions

Johannes Kirschner, Andreas Krause|arXiv (Cornell University)|Jun 6, 2019
Advanced Bandit Algorithms Research参考文献 34被引用数 17
ひとこと要約

本稿では、真のコンテキストが観測不能で、代わりにコンテキストの確率分布が与えられる状況における、新たな確率的文脈的バンディットモデルを提案する。学習者は分布のみを観測する。著者らはこの設定に適応したUCBアルゴリズムを構築し、線形およびカーネル化された報酬関数に対して、高確率的で順序的に最適なO(d√T)のレギュレートバウンドを証明している。これは、分布がデルタ関数である場合に標準的な文脈的バンディットに一般化される。

ABSTRACT

We introduce a stochastic contextual bandit model where at each time step the environment chooses a distribution over a context set and samples the context from this distribution. The learner observes only the context distribution while the exact context realization remains hidden. This allows for a broad range of applications where the context is stochastic or when the learner needs to predict the context. We leverage the UCB algorithm to this setting and show that it achieves an order-optimal high-probability bound on the cumulative regret for linear and kernelized reward functions. Our results strictly generalize previous work in the sense that both our model and the algorithm reduce to the standard setting when the environment chooses only Dirac delta distributions and therefore provides the exact context to the learner. We further analyze a variant where the learner observes the realized context after choosing the action. Finally, we demonstrate the proposed method on synthetic and real-world datasets.

研究の動機と目的

  • 真のコンテキストが観測不能で、コンテキストの確率分布のみが利用可能な状況における文脈的バンディット学習の課題に対処すること。
  • 実現されたコンテキストではなく、コンテキスト分布に基づいた最良の行動選択と競合する学習アルゴリズムを開発すること。
  • 特徴次元dおよび時間枠Tに関して、順序的に最適な高確率的レギュレートバウンドを確立すること。
  • カーネル平均埋め込みと分布リスク最小化を用いて、カーネル化された報酬関数へとフレームワークを拡張すること。
  • 行動選択後に実現されたコンテキストが観測されるという変種を分析し、適用範囲を拡大すること。

提案手法

  • モデルは各ラウンドtにおいて環境がコンテキスト分布μtを選択し、コンテキストctがμtから抽出されるが、学習者はμtのみを観測するものとする。
  • 報酬関数は特徴ベクトルφx,cに関する線形関数と仮定する:f(x,c) = φx,c⊤θ、ただしθ ∈ ℝdは未知である。
  • 観測された報酬とコンテキスト分布に基づいて、最小二乗推定器を用いてθの信頼集合を構築することで、UCBアルゴリズムをこの設定に適応する。
  • 完全な分布の知識が不要で、コンテキスト分布μtからのサンプリングのみを必要とする、実用的なアルゴリズムの変種を提案する。
  • カーネル化された設定では、報酬関数が既知のRKHSに属すると仮定し、期待報酬を推定するためにカーネル平均埋め込みを用いる。
  • 集中不等式と情報理論的ツールを用いてレギュレートをバウンドし、線形設定においてO(d√T)の高確率的レギュレートを示している。

実験結果

リサーチクエスチョン

  • RQ1真のコンテキストが隠されており、コンテキストの確率分布のみが観測可能な状況で、文脈的バンディットアルゴリズムがサブ線形なレギュレートを達成できるか?
  • RQ2コンテキスト分布に適応したUCBアルゴリズムは、線形バンディット設定において順序的に最適なレギュレートを達成するか?
  • RQ3コンテキスト分布の不確実性が存在する状況で、レギュレートバウンドは特徴次元dおよび時間枠Tに関してどのようにスケーリングされるか?
  • RQ4カーネル平均埋め込みと分布リスク最小化を用いて、フレームワークをカーネル化された報酬関数へと拡張可能か?
  • RQ5行動選択後に実現されたコンテキストを観測することで、分布のみを観測する場合に比べて性能がどの程度向上するか?

主な発見

  • 提案されたUCBに基づくアルゴリズムは、線形バンディット設定においてO(d√T)の高確率的レギュレートバウンドを達成しており、対数要因を除いて順序的に最適である。
  • 環境がコンテキスト分布を適応的に選択しても、学習者が実現されたコンテキストを観測できない状況でも、レギュレートバウンドは成立する。
  • この手法は標準的な文脈的バンディットモデルを一般化する:コンテキスト分布がデルタ関数である場合、アルゴリズムは古典的なUCBに還元される。
  • カーネル化された設定では、カーネル平均埋め込みを用いて期待報酬を推定し、レギュレートバウンドがカーネルの固有スペクトルの減衰に依存することを示している。
  • 完全な分布の知識が不要で、コンテキスト分布からのサンプリングのみが利用可能な現実世界の設定でも、アルゴリズムは実用的である。
  • 行動選択後に実現されたコンテキストが観測される変種では、レギュレートバウンドが改善され、意思決定時にコンテキスト予測を必要とする応用において、より優れた性能が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。