Skip to main content
QUICK REVIEW

[論文レビュー] Optimal Best-arm Identification in Linear Bandits

Yassir Jedra, Alexandre Proutière|arXiv (Cornell University)|Jun 29, 2020
Advanced Bandit Algorithms Research参考文献 24被引用数 19
ひとこと要約

本稿では、有限および連続的な腕を備えた確率的線形バンディットにおける、新しいスケーラブルな最適腕同定アルゴリズムを提案する。このアルゴリズムは、漸近的に最適なサンプル複雑度を達成する。手法は、最適な抽出割合を追跡する「トラックアンドストップ」原理を用い、腕の数に依存しない停止ルールを採用しており、情報理論的下界にほぼ確実かつ期待値において一致する。

ABSTRACT

We study the problem of best-arm identification with fixed confidence in stochastic linear bandits. The objective is to identify the best arm with a given level of certainty while minimizing the sampling budget. We devise a simple algorithm whose sampling complexity matches known instance-specific lower bounds, asymptotically almost surely and in expectation. The algorithm relies on an arm sampling rule that tracks an optimal proportion of arm draws, and that remarkably can be updated as rarely as we wish, without compromising its theoretical guarantees. Moreover, unlike existing best-arm identification strategies, our algorithm uses a stopping rule that does not depend on the number of arms. Experimental results suggest that our algorithm significantly outperforms existing algorithms. The paper further provides a first analysis of the best-arm identification problem in linear bandits with a continuous set of arms.

研究の動機と目的

  • 有限腕を備えた線形バンディットにおける、単純でスケーラブルかつ漸近的に最適な最適腕同定アルゴリズムの欠如を解消すること。
  • 既存のアルゴリズムと、期待サンプル複雑度におけるインスタンス固有の情報理論的下界との間のギャップを埋めること。
  • 停止ルールやサンプリングルールが腕の数に依存しない方法を考案し、スケーラビリティを向上させること。
  • 特に単位球面上の連続的腕のケースに拡張し、サンプル複雑度の下界を導出すること。
  • 導出された下界とオーダー的に一致するサンプル複雑度を持つ連続的腕用のアルゴリズムを提案すること。

提案手法

  • アルゴリズムは、パラメーターベクトルの最小二乗推定に基づき、各腕の最適な抽出割合を動的に追跡する「トラックアンドストップ」戦略を採用する。
  • 最適な抽出割合は、インスタンス固有のサンプル複雑度の下界から導出され、まれに更新されるため、「ラジオ的」な実装が可能であり、漸近的最適性を損なわない。
  • 停止ルールは、腕の数に依存しない新しい探索閾値を有する一般化尤度比検定を用いる。
  • 連続的腕の場合、アルゴリズムは単位球面を想定し、$(\epsilon,\delta)$-PAC保証を満たすように停止条件を構築する。
  • 集中不等式と強制的探索を用いて収束を保証する、ほぼ確実かつ期待値ベースの解析により理論的保証を確立する。
  • トラッキングルールの更新頻度を調整することで、計算コストを自在にチューニング可能であり、理論的最適性を維持できる。

実験結果

リサーチクエスチョン

  • RQ1線形バンディットにおける最適腕同定アルゴリズムは、サンプル複雑度の情報理論的下界に一致しつつ、単純かつスケーラブルであることができるか?
  • RQ2腕の数に依存しない停止ルールが存在するか? その場合、最適腕同定において漸近的最適性を保証できるか?
  • RQ3連続的腕集合を備えた線形バンディットにおける、インスタンス固有のサンプル複雑度の下界は何か?
  • RQ4連続的線形バンディット用に、導出された下界とオーダー的に一致するサンプル複雑度を持つアルゴリズムを設計できるか?
  • RQ5最適抽出割合の追跡ルールの更新頻度は、アルゴリズムの理論的保証および計算コストにどのように影響するか?

主な発見

  • 提案されたアルゴリズムは、サンプル複雑度において漸近的最適性を達成し、既知のインスタンス固有の下界にほぼ確実に一致する。
  • アルゴリズムの期待サンプル複雑度は、$\frac{d\sigma^2}{\varepsilon\|\mu\|}\log(1/\delta)$ で抑えられ、下界とオーダー的に一致する。
  • 停止ルールは腕の数に依存しないため、大規模または無限の腕集合に対してもスケーラブルである。
  • トラッキングルールの更新頻度を任意に低くしても漸近的最適性に影響しないため、計算コストを調整可能である。
  • 単位球面上の連続的腕に対して、サンプル複雑度の下界がオーダー $\frac{d}{\varepsilon}\log(1/\delta)$ であることが確立された。
  • この下界とオーダー的に一致するサンプル複雑度を持つ連続的腕用のアルゴリズムが提案された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。