Skip to main content
QUICK REVIEW

[論文レビュー] An Empirical Process Approach to the Union Bound: Practical Algorithms for Combinatorial and Linear Bandits

Julian Katz-Samuels, Lalit Jain|arXiv (Cornell University)|Jun 21, 2020
Advanced Bandit Algorithms Research参考文献 31被引用数 20
ひとこと要約

本稿では、純探索的線形および組み合わせ的バンディットにおけるユニオンバウンドに、Empirical Processに基づく新しいアプローチを導入する。アームに対する明示的なユニオンバウンディングを、ガウス幅に基づく設計に置き換える。提案手法は、先行研究で一般的に見られる $\log(|\mathcal{Z}|)$ 要因を回避し、アーム集合の幾何構造に応じてスケーリングされる近似的最適なサンプル複雑度を達成する。また、対数要因を除き一致する保証を持つ、トランスductive線形バンディットにおける最初の固定予算アルゴリズムを提供する。

ABSTRACT

This paper proposes near-optimal algorithms for the pure-exploration linear bandit problem in the fixed confidence and fixed budget settings. Leveraging ideas from the theory of suprema of empirical processes, we provide an algorithm whose sample complexity scales with the geometry of the instance and avoids an explicit union bound over the number of arms. Unlike previous approaches which sample based on minimizing a worst-case variance (e.g. G-optimal design), we define an experimental design objective based on the Gaussian-width of the underlying arm set. We provide a novel lower bound in terms of this objective that highlights its fundamental role in the sample complexity. The sample complexity of our fixed confidence algorithm matches this lower bound, and in addition is computationally efficient for combinatorial classes, e.g. shortest-path, matchings and matroids, where the arm sets can be exponentially large in the dimension. Finally, we propose the first algorithm for linear bandits in the the fixed budget setting. Its guarantee matches our lower bound up to logarithmic factors.

研究の動機と目的

  • 純探索的線形バンディットにおけるアームに対するナイーブなユニオンバウンディングから生じる $\log(|\mathcal{Z}|)$ 要因を削除すること。
  • 指数的に大きなアーム集合を持つ組み合わせ的バンディット(例:最短経路、マッチング、マトロイド)に対して、計算効率の良い実験的設計を構築すること。
  • ガウス幅に基づく新たな下界を確立し、根本的なサンプル複雑度の限界を同定すること。
  • 対数要因を除き一致する理論的保証を持つ、トランスductive線形バンディットにおける最初の固定予算アルゴリズムを提供すること。
  • 特に高次元および組み合わせ的設定において、既存手法に比べて経験的に優れた性能を示すこと。

提案手法

  • ガウス過程の上限をモデル化し、期待上限の最小化に寄与する TIS 不等式を用いる。
  • アーム集合 $\mathcal{Z}$ のガウス幅に基づく、新たな実験的設計目的を定義。これは、最悪の分散最小化(例:G-最適設計)に代わるものである。
  • 分布 $\lambda \in \Delta$ に対する緩和された最適化問題を解き、$\mathbb{E}_{\eta \sim N(0,I)}[\max_{z \in \mathcal{Z}_k} (\hat{z}_k - z)^\top A(\lambda)^{-1/2} \eta]$ を最小化する。ここでは、現在の最良アームからの差に焦点を当てる。
  • 2段階の近似を実装:$A(\lambda)^{-1}$-ノルムにおける期待最大偏差と最大ノルムの両方を最小化し、その後それらの設計を平均化する。
  • 2,000サンプルを用いてガウス幅を推定するため、$\lambda \in \Delta$ における確率的ミラー降下法を用いて設計を計算する。
  • 信頼区間に基づく停止ルールを予算制約付きの推奨ルールに置き換えることで、固定予算設定にアルゴリズムを適応する。

実験結果

リサーチクエスチョン

  • RQ1アーム集合の幾何的測度を用いて、明示的なユニオンバウンディングを置き換えることで、サンプル複雑度における $\log(|\mathcal{Z}|)$ 要因を排除できるか?
  • RQ2ガウス幅は、純探索的線形バンディットにおけるサンプル複雑度を支配する根本的量であるか?
  • RQ3指数的に大きなアーム集合に対して、サイズではなく幾何構造に応じてスケーリングする、計算効率の良いアルゴリズムを設計できるか?
  • RQ4固定予算線形バンディットにおける最適実験的設計は何か? また、固定信頼度の保証と比べてどう異なるか?
  • RQ5提案手法は、組み合わせ的およびトランスductive設定において、最先端のベースラインと比較して経験的にどの程度優れているか?

主な発見

  • 固定信頼度アルゴリズムのサンプル複雑度は、ガウス幅に基づく新しい下界と定数因子を除き一致し、$\log(|\mathcal{Z}|)$ のペナルティを回避する。
  • 最短経路、マッチング、マトロイドなどの組み合わせ的クラスにおいて、指数的に大きなアーム集合であっても、計算的に効率的である。
  • バイクリーク検出の実験では、ギャップが小さい場合($h = 0.2$)に、提案手法(Peace)はDisRegionに比べて3倍以上少ないサンプル数で推定を完了した。
  • 固定予算設定では、ほとんどの標準的設定において、下界と $\log(d)$ 要因を除き一致する性能を達成する。
  • いくつかの組み合わせ的バンディット設定において、既存手法に比べて1桁の性能向上を達成し、特に最良と劣化アームのギャップが小さい場合に顕著である。
  • 設計計算において上位$k$アームの差に限定することで、正しく保証された効率的近似が得られ、正しさに損なわれない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。