Skip to main content
QUICK REVIEW

[論文レビュー] Towards Optimal and Efficient Best Arm Identification in Linear Bandits

Mohammadi Zaki, Avinash Mohan|arXiv (Cornell University)|Nov 5, 2019
Advanced Bandit Algorithms Research参考文献 14被引用数 6
ひとこと要約

本稿では、最適腕同定のための新しいアルゴリズムであるGLUCBを提案する。このアルゴリズムは、信頼集合の幾何的重複を最小化することで、最も情報を得られる腕を選択する。LUCBアルゴリズムを一般化し、2腕および3腕問題において最適なサンプル複雑性を達成するとともに、各腕ペアごとの高価な最適化を回避することで計算効率を向上させる。

ABSTRACT

We give a new algorithm for best arm identification in linearly parameterised bandits in the fixed confidence setting. The algorithm generalises the well-known LUCB algorithm of Kalyanakrishnan et al. (2012) by playing an arm which minimises a suitable notion of geometric overlap of the statistical confidence set for the unknown parameter, and is fully adaptive and computationally efficient as compared to several state-of-the methods. We theoretically analyse the sample complexity of the algorithm for problems with two and three arms, showing optimality in many cases. Numerical results indicate favourable performance over other algorithms with which we compare.

研究の動機と目的

  • 固定信頼度設定下での線形バンディットにおける最適腕同定のためのサンプル効率および計算効率のギャップを埋める。
  • 理論的および実験的性能の両面で既存手法を上回る、完全に適応的かつ計算効率の高いアルゴリズムを開発する。
  • パrameter推定のための信頼集合における幾何的構造を活用することで、インスタンス最適なサンプル複雑性を達成する。
  • LinGapE(計算が重い)やY-ElimTil-p(最悪ケースでの最適性のみ)といった先行手法の制限を克服する。

提案手法

  • 最適腕の不確実性を最も小さくする腕の選択を目的とした幾何的「最大重複」原理を用いて、LUCBアルゴリズムを線形バンディットに一般化する。
  • 過去の観測に基づいて時間的に変化する未知パラメーターベクトルθの信頼集合を構築し、これらの集合間の重複を最小化するように腕を選択する。
  • 信頼区間に基づく停止基準を導入:最適腕の下限と非最適腕の上限の間にギャップが生じた場合に停止する。
  • 事前定義されたスケジュールに依存しない、現在の信頼集合の幾何的構造に動的に適応するデータ依存の腕選択ルールを導入する。
  • 線形モデルの構造を活用して、相関する観測から回帰的推論によりプレイされていない腕の報酬を推定する。
  • LinGapEとは異なり、各ラウンドごとにO(K²)の最適化問題を回避し、代わりに腕選択に閉形式の式を用いることで計算効率を確保する。

実験結果

リサーチクエスチョン

  • RQ1完全に適応的かつ計算効率の高いアルゴリズムは、線形最適腕同定においてインスタンス最適なサンプル複雑性を達成できるか?
  • RQ2信頼集合における幾何的重複は、線形バンディットにおける最適腕選択にどのように寄与するか?
  • RQ3提案されたアルゴリズムの2腕および3腕線形バンディット問題における理論的サンプル複雑性は何か?
  • RQ4サンプル効率および計算コストの両面で、最新の手法と比較してアルゴリズムの性能はどのようになるか?
  • RQ5腕が低次元部分空間に配置されているような特定の構造的設定において、アルゴリズムが最適であることが示せるか?

主な発見

  • GLUCBは、固定信頼度設定下で2腕および3腕線形バンディット問題において最適なサンプル複雑性を達成し、停止時間に関する理論的保証を有する。
  • 腕間の角度ωが小さい場合、サンプル複雑性はO(Δ⁻²_min / sin²(ω))に比例し、インスタンス固有の最適性を示す。
  • ステディステートの挙動において、GLUCBはサンプリング回数n₁とn₂の動的バランスに基づき、腕1と腕3を交互に選択し、収束を保証する。
  • 数値結果から、特に高次元設定において、GLUCBはLinGapEおよび他のベースラインをサンプル効率および計算速度の両面で上回ることが示された。
  • LinGapEが直面するO(K²)の最適化オーバーヘッドを回避するため、幾何的基準を用いることで、Kが大きい場合でもスケーラブルである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。