Skip to main content
QUICK REVIEW

[論文レビュー] Thompson Sampling Algorithms for Mean-Variance Bandits

Qiuyu Zhu, Vincent Y. F. Tan|arXiv (Cornell University)|Feb 1, 2020
Advanced Bandit Algorithms Research参考文献 21被引用数 14
ひとこと要約

本稿では、ガウス分布に従う報酬に対するMTS、VTS、MVTSおよびベルヌーイ分布に従う報酬に対するBMVTSという、新しいトムソン・サブミッションベースのアルゴリズムを提案する。これらは、リスクに配慮した意思決定を可能にする平均・分散マルチアームバンディット問題に適応されたものである。著者らは、特定の条件下で情報理論的限界と一致するタイトなレグレットバウンドを提供し、シミュレーションを通じて、あらゆるリスク許容度において、従来のLCBベースの手法を著しく上回ることを示している。

ABSTRACT

The multi-armed bandit (MAB) problem is a classical learning task that exemplifies the exploration-exploitation tradeoff. However, standard formulations do not take into account {\em risk}. In online decision making systems, risk is a primary concern. In this regard, the mean-variance risk measure is one of the most common objective functions. Existing algorithms for mean-variance optimization in the context of MAB problems have unrealistic assumptions on the reward distributions. We develop Thompson Sampling-style algorithms for mean-variance MAB and provide comprehensive regret analyses for Gaussian and Bernoulli bandits with fewer assumptions. Our algorithms achieve the best known regret bounds for mean-variance MABs and also attain the information-theoretic bounds in some parameter regimes. Empirical simulations show that our algorithms significantly outperform existing LCB-based algorithms for all risk tolerances.

研究の動機と目的

  • リスクに配慮した平均・分散マルチアームバンディット問題における、トムソン・サブミッションベースのアルゴリズムの欠如を是正すること。
  • 従来の研究よりも弱い仮定の下で動作するアルゴリズムの開発。特に、報酬分布がサブガウス分布を満たす必要がないようにすること。
  • 情報理論的下界と一致するか、それらを一般化するレグレットバウンドを達成すること。
  • 最先端のLCBベースの手法と比較して、多様なリスク許容度において優れた性能を実証的に検証すること。

提案手法

  • ガウス分布に従う報酬のためのMTS、VTS、MVTSを提案。それぞれ異なるリスクと分散の状態に適応する。
  • ベルヌーイ分布に従う報酬のためのBMVTSを導入。これにより、二値の結果に対してもフレームワークが拡張される。
  • サブガウス仮定を不要とするために、新規の反拡散不等式(補題3および補題4)を用いてレグレットを分析。
  • マーケウィッツの平均・分散基準を用いて、平均と分散を組み合わせたリスク回避型の目的関数を採用。
  • 集中不等式と尾確率解析を用いて、有限時間におけるレグレットバウンドを導出。
  • 理論的解析を通じて、特定のパrameter領域において、レグレットが情報理論的下界と一致することを示した。

実験結果

リサーチクエスチョン

  • RQ1一般の報酬分布の下で、トムソン・サブミッションが平均・分散マルチアームバンディット問題に効果的に適応可能か?
  • RQ2提案されたアルゴリズムは、情報理論的下界と一致するか、それに近いレグレットバウンドを達成するか?
  • RQ3アルゴリズムは、あらゆるレベルのリスク許容度において、従来のLCBベースの手法を上回る性能を示せるか?
  • RQ4非サブガウス分布の下で、時間と最適アームと劣悪アームの差(ギャップ)に応じて、レグレットバウンドはどのようにスケーリングするか?
  • RQ5報酬分布がガウス分布またはベルヌーイ分布である場合、平均・分散バンディット問題におけるトムソン・サブミッションの理論的保証は何か?

主な発見

  • 提案されたMVTSアルゴリズムは、平均・分散MAB問題における最高の既知のレグレットバウンドを達成し、特定のパrameter領域では情報理論的下界と一致する。
  • ガウス分布に従うバンディット問題において、サブガウス仮定を必要とせず、Agrawal & Goyal (2012) の先行研究の結果を一般化するレグレットバウンドを達成している。
  • ベルヌーイ分布に従うバンディット問題のためのBMVTSアルゴリズムは、主項がO(log n)に比例する有限時間におけるレグレットバウンドを達成しており、1/εに関する多項式項も含む。
  • 経験的結果から、MVTSは全テストされたリスク許容度(ρ)において、常にLCBベースの手法を上回ることが示された。
  • 理論的解析により、レグレットは最適アームの平均と分散の差およびリスクパラメータρに依存することが判明。新規の反拡散不等式を用いて、よりタイトなバウンドが導出された。
  • BMVTSの有限時間におけるレグレットバウンドには、O(1/ε²)およびO(1/ε)に比例する項が含まれており、ε = (log n)^(-1/4)と選ぶことで、これらは制御可能となり、漸近的レグレットがO(log n)に収束する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。