Skip to main content
QUICK REVIEW

[論文レビュー] The Multi-fidelity Multi-armed Bandit

Kirthevasan Kandasamy, Gautam Dasarathy|arXiv (Cornell University)|Oct 30, 2016
Advanced Bandit Algorithms Research被引用数 10
ひとこと要約

本稿では、各アームを複数の忠実度でサンプリング可能で、それぞれ異なるコストとバイアスを持つ確率的マルチアームバンディット問題に対して、多忠実度上界付き確信度(MF-UCB)アルゴリズムを提案する。低コストで精度の低い忠実度の近似を活用して、劣悪なアームを迅速に除外することで、標準的なUCBと比較してレギュレートを低減する。理論的境界のもとでほぼ最適な性能を達成し、合成問題において優れた実験的結果を示している。

ABSTRACT

We study a variant of the classical stochastic $K$-armed bandit where observing the outcome of each arm is expensive, but cheap approximations to this outcome are available. For example, in online advertising the performance of an ad can be approximated by displaying it for shorter time periods or to narrower audiences. We formalise this task as a multi-fidelity bandit, where, at each time step, the forecaster may choose to play an arm at any one of $M$ fidelities. The highest fidelity (desired outcome) expends cost $λ^{(m)}$. The $m^{ ext{th}}$ fidelity (an approximation) expends $λ^{(m)} < λ^{(M)}$ and returns a biased estimate of the highest fidelity. We develop MF-UCB, a novel upper confidence bound procedure for this setting and prove that it naturally adapts to the sequence of available approximations and costs thus attaining better regret than naive strategies which ignore the approximations. For instance, in the above online advertising example, MF-UCB would use the lower fidelities to quickly eliminate suboptimal ads and reserve the larger expensive experiments on a small set of promising candidates. We complement this result with a lower bound and show that MF-UCB is nearly optimal under certain conditions.

研究の動機と目的

  • アームを異なる忠実度でサンプリング可能で、コストは増加し、バイアスは減少する多忠実度バンディット設定を形式化すること。
  • 高忠実度の結果が高価であるが、低価格でバイアスのある近似が利用可能な状況における、探索と活用のトレードオフを扱うこと。
  • 探索には低忠実度を適応的に使用し、有望なアームに対してのみ高忠実度のクエリを割り当てることを目的としたアルゴリズムの開発。
  • 提案手法のレギュレートを理論的に特徴付け、特定の条件下でほぼ最適であることを示すこと。
  • MF-UCBが高忠実度のプル回数を減らしつつも累積レギュレートを低く抑えることができることを実験的に検証すること。

提案手法

  • MF-UCBは、忠実度レベルとサンプリングコストを考慮した信頼区間を組み込むことで、古典的なUCBの原則を拡張する。
  • 各アームについて、各忠実度レベルごとに別々の信頼区間を維持し、高忠実度ではより狭い区間を採用する。
  • 階層的な選択戦略を採用:低忠実度を用いて、期待報酬が低いアームを早期に特定・除外する。
  • 推定された報酬差とコスト対分散比に基づき、忠実度間でサンプリング予算を動的に割り当てる。
  • 忠実度 $m$ における推定性能でアームをグループ化するための集合 $\mathcal{K}^{(m)}$ を定義し、構造的な探索を可能にする。
  • 理論的分析では、報酬バイアスと分散に関する仮定を置き、測度変換の議論を用いてレギュレートの下界を導出する。

実験結果

リサーチクエスチョン

  • RQ1高価な高忠実度実験において、低コストでバイアスのある近似を効果的に活用することで、レギュレートを低減できるか?
  • RQ2複数の忠実度にわたり、累積レギュレートを最小化するように、サンプリング努力をどのように配分すべきか?
  • RQ3多忠実度バンディットアルゴリズムの理論的レギュレート下限は何か? そして、標準UCBと比べてどうなるか?
  • RQ4MF-UCBは、レギュレートにおいてほぼ最適であるか? どのような条件下で達成されるか?
  • RQ5実際の応用において、低忠実度近似の使用が、高忠実度クエリの割り当てにどのように影響を与えるか?

主な発見

  • MF-UCBは、$\mathcal{O}\left((\lambda^{(1)}K + \lambda^{(2)}|\mathcal{K}_g|)\log(\Lambda / \lambda^{(2)})\right)$ のレギュレートバウンドを達成し、$\lambda^{(1)} < \lambda^{(2)}$ かつ $|\mathcal{K}_g| < K$ のとき、標準UCBよりも優れている。
  • アルゴリズムは低忠実度を用いて探索と劣悪なアームの除外を実施し、高忠実度プルを有望な候補の少数に限定する。
  • 実験結果から、MF-UCBはガウス分布およびベルヌーイ分布の報酬を有する複数の合成問題において、常に標準UCBを上回る性能を示している。
  • MF-UCBのレギュレート勾配はUCBより小さく、プル回数の増加に伴うスケーリングがより有利であることを示している。
  • 理論的下界として、レギュレートの下限が導出され、与えられた仮定のもとでMF-UCBがほぼ最適であることが示された。
  • アルゴリズムの性能は忠実度レベルの選択に対して頑健であり、$\lambda^{(1)} \ll \lambda^{(2)}$ の場合に顕著なコスト削減が達成される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。