Skip to main content
QUICK REVIEW

[論文レビュー] Thompson Sampling for Combinatorial Multi-armed Bandit with Probabilistically Triggered Arms

Alihan Hüyük, Cem Tekin|arXiv (Cornell University)|Sep 7, 2018
Advanced Bandit Algorithms Research被引用数 3
ひとこと要約

本稿は、半バンドイットフィードバック下での確率的トリガー付き組合せ的マルチアームバンディットに対して、組合せ的トマソンサンプリング(CTS)を提案する。報酬関数が期待される基本アームの結果に関してリプシッツ連続である場合、O(∑ₘᵢ₌₁ log T / (pᵢΔᵢ)) のレギュレートバウンドを確立し、実験でCUCBを上回ることを示している。

ABSTRACT

We analyze the regret of combinatorial Thompson sampling (CTS) for the combinatorial multi-armed bandit with probabilistically triggered arms under the semi-bandit feedback setting. We assume that the learner has access to an exact optimization oracle but does not know the expected base arm outcomes beforehand. When the expected reward function is Lipschitz continuous in the expected base arm outcomes, we derive $O(\sum_{i =1}^m \log T / (p_i \Delta_i))$ regret bound for CTS, where $m$ denotes the number of base arms, $p_i$ denotes the minimum non-zero triggering probability of base arm $i$ and $\Delta_i$ denotes the minimum suboptimality gap of base arm $i$. We also show that CTS outperforms combinatorial upper confidence bound (CUCB) via numerical experiments.

研究の動機と目的

  • 組合せ的マルチアームバンディットに確率的トリガー付きアームを適用した場合の組合せ的トマソンサンプリング(CTS)のレギュレート性能を分析すること。
  • 期待報酬関数がリプシッツ連続であると仮定した場合の、半バンドイットフィードバック下でのCTSの理論的レギュレートバウンドを確立すること。
  • CTSを組合せ的上限信頼性(CUCB)と比較し、レギュレート性能の観点から実験的に評価すること。
  • トリガーリング確率とサブオプティマルギャップがCTSのレギュレートに与える影響を調査すること。

提案手法

  • CTSは、期待される基本アームの結果に関する事後分布からサンプリングするためにトマソンサンプリングを用いる。
  • 本手法は、各ラウンドで最良の組合せアームを選択するために正確な最適化オラクルへのアクセスを仮定する。
  • レギュレート解析の滑らかさを保証するために、報酬関数が期待される基本アームの結果に関してリプシッツ連続であると仮定する。
  • 集中不等式およびトリガーリング確率とサブオプティマルギャップの性質を用いて、レギュレートバウンドを導出する。
  • 選択されたアームのサブセットが確率的に追加の報酬を引き起こす可能性がある確率的トリガリングを分析に組み込む。
  • 数値実験では、同一の設定下でCTSとCUCBの両者を比較し、実験的レギュレートを評価する。

実験結果

リサーチクエスチョン

  • RQ1確率的トリガー付きアーム設定下での組合せ的トマソンサンプリング(CTS)の理論的レギュレートバウンドは何か?
  • RQ2報酬関数のリプシッツ連続性がCTSのレギュレートパフォーマンスに与える影響は何か?
  • RQ3CTSは、レギュレートの観点から、組合せ的上限信頼性(CUCB)と比較してどのように異なるか?
  • RQ4最小トリガーリング確率(pᵢ)とサブオプティマルギャップ(Δᵢ)は、レギュレートバウンドにおいてどのような役割を果たすか?
  • RQ5同じフィードバックおよび最適化制約下で、CTSはCUCBを上回るレギュレートパフォーマンスを達成できるか?

主な発見

  • 本稿では、提示された仮定の下で、CTSのレギュレートバウンドが O(∑ₘᵢ₌₁ log T / (pᵢΔᵢ)) であることを確立した。
  • レギュレートバウンドは、各基本アームの非ゼロ最小トリガーリング確率(pᵢ)およびサブオプティマルギャップ(Δᵢ)の逆数に依存する。
  • 数値実験において、CTSがCUCBを上回ることが示され、優れた実験的パフォーマンスが裏付けられた。
  • 理論的バウンドは、期待される基本アームの結果における報酬関数のリプシッツ連続性の仮定に基づいて導出された。
  • 半バンドイットフィードバック下でも、トリガーされたアームの報酬が個別に観測可能であるという条件を満たす。
  • 結果は、同じ条件下で既存の手法と比較して、CTSがよりタイトなレギュレートバウンドを達成できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。