Skip to main content
QUICK REVIEW

[論文レビュー] Infinite Arms Bandit: Optimality via Confidence Bounds

Hock Peng Chan, Shouri Hu|arXiv (Cornell University)|May 30, 2018
Advanced Bandit Algorithms Research参考文献 27被引用数 3
ひとこと要約

本稿は、報酬が有界である無限腕バンディット問題に対して、事前分布または経験的に導かれるターゲット値に対する信頼区間に基づいて腕を選択するConfidence Bound Target(CBT)アルゴリズムを提案する。CBTは有界報酬において理論的下界に一致する最適なレグレットバウンドを達成し、事前知識がなくても動作する経験的バージョンは、ベルヌーイ分布および実世界のURLデータセットにおけるシミュレーションで他の手法を上回る性能を示す。

ABSTRACT

Berry et al. (1997) initiated the development of the infinite arms bandit problem. They derived a regret lower bound of all allocation strategies for Bernoulli rewards with uniform priors, and proposed strategies based on success runs. Bonald and Proutière (2013) proposed a two-target algorithm that achieves the regret lower bound, and extended optimality to Bernoulli rewards with general priors. We present here a confidence bound target (CBT) algorithm that achieves optimality for rewards that are bounded above. For each arm we construct a confidence bound and compare it against each other and a target value to determine if the arm should be sampled further. The target value depends on the assumed priors of the arm means. In the absence of information on the prior, the target value is determined empirically. Numerical studies here show that CBT is versatile and outperforms its competitors.

研究の動機と目的

  • 腕の数が無限で、報酬が上界に有界である無限腕バンディット問題における最適な割り当ての課題に取り組む。
  • 有界報酬における理論的レグレット下界を達成する手法を開発し、ベルヌーイ分布および指数型分布族に関する先行研究を拡張する。
  • 腕の平均分布の事前知識がなくても動作する実用的バージョンのアルゴリズムを提供するため、ターゲット値を経験的に推定する。
  • 多様な報酬分布および実世界のデータにおいて、提案手法の頑健性と優位性を示す。

提案手法

  • 観測された標本に基づいて、各腕の期待報酬に対する上側信頼区間(UCB)を構築する。
  • 腕の平均の仮定された事前分布に基づいてターゲット値を定義し、その腕をさらに探索すべきかどうかを決定する。
  • 各腕の信頼区間をターゲット値と比較する:信頼区間がターゲット値を上回る場合、その腕が選択され、そうでない場合は除外される。
  • 事前分布が不明な場合、初期サンプルからターゲット値を経験的に推定することで、経験的CBTバージョンを可能にする。
  • 最適性の妥当性を検証するため、普遍的なレグレット下界をベンチマークとして用いる。
  • 順次的にアルゴリズムを適用し、時間経過に伴い信頼区間とターゲット値を動的に更新することで、探索と活用のバランスを取る。

実験結果

リサーチクエスチョン

  • RQ1有界報酬における無限腕バンディット問題において、信頼区間ベースの手法が理論的レグレット下界に到達できるか。
  • RQ2パrametric仮定に依存せずに最適性を保証するため、信頼区間比較におけるターゲット値をどのように選択できるか。
  • RQ3真の事前分布が不明な場合、アルゴリズムの経験的バージョンの性能はいかがなものか。
  • RQ4二つのターゲット法、UCB-F、POKERといった既存手法と比較して、提案されたCBTアルゴリズムのレグレットとスケーラビリティはどの程度か。
  • RQ5未知の報酬構造を有する実世界のデータセットに対しても、CBTフレームワークは効果的に適用可能か。

主な発見

  • CBTアルゴリズムは、有界報酬における普遍的なレグレット下界に到達し、あらゆる可能な戦略の理論的最小レグレットと一致する。
  • 事前知識があるベルヌーイ報酬において、CBTは二つのターゲット法やUCB-Fを一貫して上回り、全テストサンプルサイズで低いレグレットを達成する。
  • 経験的CBTは、二つのターゲット法と同等の性能を示し、ε-greedy や ε-first といった標準ベースラインを著しく上回る。
  • URLデータセットでは、n=1300 の大規模なサンプルサイズにおいて、経験的CBTがPOKERをレグレットで上回り、優れたスケーラビリティと適応性を示す。
  • 最適なCBTは閾値ζを設定するための事前知識を必要とするが、経験的CBTはその知識がなくてもほぼ最適な性能を達成でき、より実用的である。
  • 数値結果から、CBTのレグレットはβ=2の場合はCn^(2/3)、β=3の場合はCn^(3/4)とスケーリングされ、すべての設定で理論的下界に非常に近い。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。