Skip to main content
QUICK REVIEW

[論文レビュー] Generalized Thompson Sampling for Contextual Bandits

Lihong Li|arXiv (Cornell University)|Oct 27, 2013
Advanced Bandit Algorithms Research参考文献 17被引用数 17
ひとこと要約

本稿では、カスタマイズ可能な損失関数を用いて、専門家学習フレームワーク内でのトムソンサンプリングを統一する、一般化トムソンサンプリング(GTS)と呼ばれる、文脈的バンディットアルゴリズムの新規族を導入する。特に二乗損失および対数損失における損失関数の自己有界性を活用することで、事前分布が学習性能に与える影響を明示的に定量化するレギュレートバウンドを導出する。これにより、理論的裏付けが与えられ、柔軟性に富んだ、従来の手法の代替手段が提供される。

ABSTRACT

Thompson Sampling, one of the oldest heuristics for solving multi-armed bandits, has recently been shown to demonstrate state-of-the-art performance. The empirical success has led to great interests in theoretical understanding of this heuristic. In this paper, we approach this problem in a way very different from existing efforts. In particular, motivated by the connection between Thompson Sampling and exponentiated updates, we propose a new family of algorithms called Generalized Thompson Sampling in the expert-learning framework, which includes Thompson Sampling as a special case. Similar to most expert-learning algorithms, Generalized Thompson Sampling uses a loss function to adjust the experts' weights. General regret bounds are derived, which are also instantiated to two important loss functions: square loss and logarithmic loss. In contrast to existing bounds, our results apply to quite general contextual bandits. More importantly, they quantify the effect of the "prior" distribution on the regret bounds.

研究の動機と目的

  • 一般的な文脈的バンディットにおけるトムソンサンプリングの事前分布の役割を明示的に定量化する理論的レギュレートバウンドの欠如に対処すること。
  • パrametric仮定を超えてトムソンサンプリングを一般化する統一的フレームワークを、専門家学習のパラダイムを用いて開発すること。
  • 事前分布の正しさや尤度分布に関する強い仮定に依存せずに、非線形および一般な文脈的バンディット設定に適用可能なレギュレートバウンドを導出すること。
  • 損失関数を通じて、トムソンサンプリングと指数更新ルールとの間の関係を確立し、より広範な理論的分析を可能にすること。

提案手法

  • 専門家学習フレームワーク内に、各専門家がアーム選択の文脈的方策を表す、一般化トムソンサンプリング(GTS)のアルゴリズム族を提案する。
  • 期待報酬の予測精度に基づいて専門家重みを更新する損失関数を用い、対数損失が使用される場合にトムソンサンプリングが特別なケースとして現れる。
  • 損失関数の新しい自己有界性特性を適用し、二乗損失および対数損失に対して厳密な解析を用いてレギュレートバウンドを導出する。
  • 事前分布が学習性能に与える影響を明示的に組み込んだ、問題依存のレギュレートバウンドを導出する。
  • 損失確率変数のモーメントバウンドに依存する、競合分析技術を用い、特に対数損失の自己有界性を示す重要な補題を証明する。
  • カバーの議論を用いて、連続な専門家クラスへとフレームワークを拡張し、有限な専門家集合を超えた適用可能性を示唆する。

実験結果

リサーチクエスチョン

  • RQ1パラメトリックモデルを超えた一般な文脈的バンディット設定において、トムソンサンプリングをどのように一般化すれば、理論的レギュレートバウンドを提供できるか?
  • RQ2文脈的バンディット学習における事前分布のレギュレートに与える定量的影響は何か? そして、その影響をバウンドに形式的に組み込むにはどうすればよいか?
  • RQ3損失に基づく専門家重み付けを用いて、トムソンサンプリングと専門家学習アルゴリズムを統一するフレームワークを構築できるか?
  • RQ4オンライン学習および文脈的バンディットにおけるタイトなレギュレート解析を可能にする損失関数の性質は何か? そして、その性質を形式的に特徴づけるにはどうすればよいか?

主な発見

  • 一般化トムソンサンプリングは、事前分布の影響を明示的に定量化する、一般な文脈的バンディットクラスに対して初めての $ O(T^{2/3}) $ のレギュレートバウンドを達成する。
  • 本研究では、対数損失の自己有界性が初めて証明される。これは、真の確率と予測確率に依存しない定数で抑えられる、シフトされた損失の分散と平均の比が成立することを示す。
  • 対数損失の場合、有界な対数比率のもとで $ M_2 / M_1 = O(1) $ が成り立つことが分析で示されている。ここで $ M_1 $ と $ M_2 $ は損失の第一および第二モーメントを表す。
  • レギュレートバウンドは、専門家に関する事前分布を通じて依存しており、ベイジアン事前分布と頻度主義のロバストネスの利点を組み合わせた分析であり、PAC-Bayesバウンドに類似している。
  • フレームワークは、標準的なベイジアン更新を超えてトムソンサンプリングを一般化し、任意の損失関数を用いて専門家重みの更新を誘導できる。
  • 回帰子削除法などの類似アルゴリズムに比べ、計算的にもより効率的であり、バランスの取れた分布の計算が高コストである点を回避できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。