Skip to main content
QUICK REVIEW

[論文レビュー] Approximation Algorithms for Bayesian Multi-Armed Bandit Problems

Sudipto Guha, Kamesh Munagala|arXiv (Cornell University)|Jun 14, 2013
Advanced Bandit Algorithms Research参考文献 58被引用数 9
ひとこと要約

本稿では、メトリックなスイッチングコスト、遅延フィードバック、凹関数報酬、探索後に利用するモデルといった複雑な制約を伴う有限ホライズンのベイジアンマルチアームバンディット問題に対して、一貫した近似アルゴリズムの設計フレームワークを提示する。弱く結合された線形計画緩和問題を定式化し、近似的に最適なグローバル性能を達成するコンパクトで順序付けられた単一アームポリシーを構築することで実現される。主な貢献は、スイッチングコスト下でのバジェット付き学習に対して(3+ε)-近似アルゴリズムを提供することであり、他の制約付きバージョンへも有界な近似比を保証する形で一般化可能である。

ABSTRACT

In this paper, we consider several finite-horizon Bayesian multi-armed bandit problems with side constraints which are computationally intractable (NP-Hard) and for which no optimal (or near optimal) algorithms are known to exist with sub-exponential running time. All of these problems violate the standard exchange property, which assumes that the reward from the play of an arm is not contingent upon when the arm is played. Not only are index policies suboptimal in these contexts, there has been little analysis of such policies in these problem settings. We show that if we consider near-optimal policies, in the sense of approximation algorithms, then there exists (near) index policies. Conceptually, if we can find policies that satisfy an approximate version of the exchange property, namely, that the reward from the play of an arm depends on when the arm is played to within a constant factor, then we have an avenue towards solving these problems. However such an approximate version of the idling bandit property does not hold on a per-play basis and are shown to hold in a global sense. Clearly, such a property is not necessarily true of arbitrary single arm policies and finding such single arm policies is nontrivial. We show that by restricting the state spaces of arms we can find single arm policies and that these single arm policies can be combined into global (near) index policies where the approximate version of the exchange property is true in expectation. The number of different bandit problems that can be addressed by this technique already demonstrate its wide applicability.

研究の動機と目的

  • メトリックなスイッチングコスト、遅延フィードバック、凹関数報酬関数といった複雑な制約を伴う有限ホライズンのベイジアンマルチアームバンディット問題に対する、効率的で近似的に最適なアルゴリズムの欠如に対処すること。
  • これらの変種がNP困難であることを踏まえ、多項時間計算可能性を保ちつつ一般化可能な近似フレームワークを構築することにより、その非効用性を克服すること。
  • 標準のインデックスポリシーが交換性の性質を満たさない場合に失敗するが、それでも最適報酬の定数倍近似を達成できる、実行可能でグローバルなポリシーを設計すること。
  • STOC '07、ICALP '09、APPROX '13における先行研究の結果を統合し、より広範な適用性を持つ一貫したフレームワークに統一すること。
  • LP緩和をポリシー設計に用いる理論的根拠を提示し、インデックスポリシーと同等の計算コストで、かつ保証された性能を達成できるポリシーを設計すること。

提案手法

  • 個々のアームのポリシーを表す変数と、アーム間の整合性制約を含む弱く結合された線形計画緩和問題を定式化し、制約付きバンディット問題の構造を捉える。
  • 個々のアームの状態空間を制限することで、緩和問題の多項式時間での解法を保証し、コンパクトな単一アームポリシーの効率的計算を可能にする。
  • スイッチングコストやホライズン制約を満たすスケジューリング戦略を用いて、これらの単一アームポリシーをグローバルなポリシーとして順序付け実行する。
  • アムオリゼート会計法を用いて、グローバルポリシーの期待報酬を、すべてのスケジュールされた行動を完了する仮想の非実行可能ポリシーと比較することで、期待報酬の上限を導出する。
  • 報酬のマルティングルの性質を活用し、ホライズンに達した時点で現在のポリシーを早期終了し、現在のアームを選択することで、完全実行よりも少なくとも同じ報酬が得られることを示す。
  • ラグランジュ緩和技術と目的関数のギャップの境界を用いて、LP緩和の解と最適解との関係を分析し、近似保証を導出する。

実験結果

リサーチクエスチョン

  • RQ1メトリックなスイッチングコスト、遅延フィードバック、凹関数報酬関数を伴うベイジアンマルチアームバンディット問題に対し、そのNP困難性にもかかわらず、定数倍近似アルゴリズムを設計できるか?
  • RQ2インデックスポリシーに不可欠な交換性の性質が成り立たない制約付きバンディットモデルにおいて、その性質をどの程度まで近似的に回復できるか?
  • RQ3弱く結合されたLP緩和問題を用いて、計算効率が良く、インデックスポリシーに類似した構造を持つ実行可能で近似的に最適なグローバルポリシーを設計できるか?
  • RQ4スイッチングコスト制約付きのバジェット付き学習において達成可能な近似比は何か?また、複数のナップサック型制約へどのように一般化できるか?
  • RQ5現在の境界が最適でない大規模な遅延や同時フィードバックモデルを扱えるように、このフレームワークを拡張できるか?

主な発見

  • 提案されたポリシーFinal(λ*)は、少なくともLPBud/(3+ε)の報酬を達成し、スイッチングコスト制約下でのバジェット付き学習問題に対して(3+ε)-近似を達成する。
  • 現在の単一アームポリシーを時刻Tで完全に実行する非実行可能ポリシーは、期待報酬が少なくともLPBud/(3+ε)以上であるため、実行可能ポリシーの下界として機能する。
  • マルティングルの性質により、時刻Tで現在のポリシーを停止し、現在のアームを選択することで、完全実行よりも少なくとも同じ報酬が得られることを示し、終了戦略の妥当性を裏付ける。
  • 単一アームポリシーQ̃i(λ)が要因αで近似可能であるならば、グローバルポリシーはスイッチングコスト付きバジェット付き学習問題に対して(α+2+ε)-近似を達成する。
  • このフレームワークはr個の追加ナップサック型制約へ一般化可能であり、(r+2+ε)-近似を達成する。これにより、広範な適用可能性が示された。
  • 緩和とポリシー構築は計算的に効率的であり、追加の制約が加わっても、標準のインデックスポリシーと同等の複雑さを持つポリシーを生成可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。