Skip to main content
QUICK REVIEW

[論文レビュー] Contextual Bandits with Stochastic Experts

Rajat Sen, Karthikeyan Shanmugam|arXiv (Cornell University)|Feb 23, 2018
Advanced Bandit Algorithms Research参考文献 27被引用数 4
ひとこと要約

本稿では、確率的エキスパートを備えたコンテキストバンドイットに対して、重要度サンプリング推定器を用いてエキスパート間の情報漏洩いを活用するUCBベースのアルゴリズムを提案する。インスタンス依存のリグレットバウンドとして、$\mathcal{O}(\lambda(\boldsymbol{\mu})\mathcal{M}\log T/\Delta)$ を達成し、ここで $\lambda(\boldsymbol{\mu})$ は一般的に $\mathcal{O}(\log N)$ である。実世界のデータセットにおいて、最先端の手法と比較して優れた経験的性能を示している。

ABSTRACT

We consider the problem of contextual bandits with stochastic experts, which is a variation of the traditional stochastic contextual bandit with experts problem. In our problem setting, we assume access to a class of stochastic experts, where each expert is a conditional distribution over the arms given a context. We propose upper-confidence bound (UCB) algorithms for this problem, which employ two different importance sampling based estimators for the mean reward for each expert. Both these estimators leverage information leakage among the experts, thus using samples collected under all the experts to estimate the mean reward of any given expert. This leads to instance dependent regret bounds of $\mathcal{O}\left(λ(\pmbμ)\mathcal{M}\log T/Δ ight)$, where $λ(\pmbμ)$ is a term that depends on the mean rewards of the experts, $Δ$ is the smallest gap between the mean reward of the optimal expert and the rest, and $\mathcal{M}$ quantifies the information leakage among the experts. We show that under some assumptions $λ(\pmbμ)$ is typically $\mathcal{O}(\log N)$, where $N$ is the number of experts. We implement our algorithm with stochastic experts generated from cost-sensitive classification oracles and show superior empirical performance on real-world datasets, when compared to other state of the art contextual bandit algorithms.

研究の動機と目的

  • コンテキストバンドイットにおける決定的エキスパートの制限を克服するため、条件付きアーム分布を持つ確率的エキスパートを導入すること。
  • エキスパート間の情報漏洩いを活用するUCBスタイルのアルゴリズムを開発すること。
  • アーム数だけでなく、エキスパートの類似性と報酬ギャップに依存するインスタンス依存のリグレットバウンドを導出すること。
  • コストセンシティブ分類オラクルを用いて、実世界のデータセット上で提案されたアルゴリズムの経験的妥当性を検証すること。
  • アーム数だけでなく、エキスパートの発散と報酬ギャップに依存する理論的保証を提供すること。

提案手法

  • 全エキスパートの下で収集されたサンプルから、重要度サンプリング推定器を用いてエキスパート平均報酬を推定するUCBベースのアルゴリズムを2つ提案する。
  • 新しい確率的エキスパートをコストセンシティブ分類オラクルを用いて定期的に追加するバッチ学習手順を導入する。
  • 報酬推定の頑健性と分散低減のため、メジアン・オブ・モーメンツ(MOM)推定器と経験的平均推定器を用いる。
  • エキスパート間の発散を測る指標を用いて情報漏洩いを定量化し、その影響を $\mathcal{M}$ 項を通じてリグレットバウンドに反映する。
  • ブートストラップとキャリブレート済み分類器(XGBoost、ロジスティック回帰)を用いて多様な確率的エキスパートを生成する。
  • アルゴリズムをバッチ形式で実行し、探索と適応のバランスを取るために、$\mathcal{O}(\sqrt{t})$ ステップごとにエキスパートと発散推定値を更新する。

実験結果

リサーチクエスチョン

  • RQ1確率的エキスパート間の情報漏洩いを活用することで、コンテキストバンドイットにおけるリグレットを低減できるか?
  • RQ2確率的エキスパート間で重要度サンプリングを用いる場合、どのようなインスタンス依存のリグレットバウンドが達成可能か?
  • RQ3実世界データにおいて、確率的エキスパートを用いたUCBアルゴリズムは、最先端のコンテキストバンドイット手法と比較してどの程度の性能を示すか?
  • RQ4理論的リグレットバウンドを、アーム数ではなくエキスパート発散と報酬ギャップの観点から表現できるか?
  • RQ5キャリブレート済みの確率的エキスパートを用いることで、決定的またはグリーディなベースラインと比較して経験的性能が向上するか?

主な発見

  • MOM推定を用いた提案されたD-UCBアルゴリズムは、イーストのデータセットで平均損失0.61を達成し、バギング(0.63)や他のベースラインを上回った。
  • ストリームアナリティクスのデータセットでは、D-UCB-MOMは平均損失9%に収束し、バギング(8%)とほぼ同等の性能を示したが、理論的保証を備えていた。
  • レターズデータセットでは、D-UCB-MOMは他のすべてのアルゴリズムを著しく上回り、高次元かつ多クラス設定において顕著な経験的優位性を示した。
  • 理論的リグレットバウンドは $\mathcal{O}(\lambda(\boldsymbol{\mu})\mathcal{M}\log T/\Delta)$ とスケーリングされ、$\lambda(\boldsymbol{\mu})$ は一般的に $\mathcal{O}(\log N)$ であるため、エキスパート数に伴う良好なスケーリングが示された。
  • 特にストリームアナリティクスのデータセットにおいて、エキスパート数が増加するに従い、ギャップ依存のリグレット項がUCB-1のバウンドよりもゆっくりと増加する傾向を示した。
  • すべてのデータセットでハイパーパramータチューニングなしに良好な性能を維持し、固定定数と基本分類器を用いていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。