Skip to main content
QUICK REVIEW

[論文レビュー] Sub-sampling for Efficient Non-Parametric Bandit Exploration

Dorian Baudry, Emilie Kaufmann|arXiv (Cornell University)|Oct 27, 2020
Advanced Bandit Algorithms Research被引用数 5
ひとこと要約

本稿では、ランダムブロックサブサンプリングに基づく新規なマルチアームバンディットアルゴリズムRB-SDAを提案する。このアルゴリズムは、ベルヌーイ、ガウス、ポアソンの複数の分布族に対して、分布に特化したチューニングを必要とせずに、漸近的に最適なリグレットを達成する。トムソンサンプリングとは異なり、RB-SDAはサブサンプリング・デュエルリングアルゴリズム(SDA)フレームワーク内で再サンプリング戦略を用いて、探索と活用のバランスを図り、対数的リグレットを証明し、1パラメータ指数型分布族に対してLai-Robbinsの下界に一致する。

ABSTRACT

In this paper we propose the first multi-armed bandit algorithm based on re-sampling that achieves asymptotically optimal regret simultaneously for different families of arms (namely Bernoulli, Gaussian and Poisson distributions). Unlike Thompson Sampling which requires to specify a different prior to be optimal in each case, our proposal RB-SDA does not need any distribution-dependent tuning. RB-SDA belongs to the family of Sub-sampling Duelling Algorithms (SDA) which combines the sub-sampling idea first used by the BESA [1] and SSMC [2] algorithms with different sub-sampling schemes. In particular, RB-SDA uses Random Block sampling. We perform an experimental study assessing the flexibility and robustness of this promising novel approach for exploration in bandit models.

研究の動機と目的

  • 分布の背後にある分布の知識を事前に必要とせずに、複数の分布族にわたって漸近的に最適なリグレットを達成する非パラメトリックバンディットアルゴリズムの開発。
  • 最適性を達成するために分布に特化した事前分布を必要とするトムソンサンプリングの限界を克服すること。
  • 再サンプリングに基づくアルゴリズムを設計し、対数的リグレットを維持するとともに、分布仮定に対してロバストであること。
  • 腕の分布に関する一般条件の下で、新しいアルゴリズムクラスであるサブサンプリング・デュエルリングアルゴリズム(SDA)の理論的保証を確立すること。
  • 強制的探索を、$ f_r = \sqrt{\log r} $ の割合で行うことで、1パラメータ指数型分布族に対して漸近的最適性が保証されることを証明すること。

提案手法

  • RB-SDAは、サブサンプリング・デュエルリングアルゴリズム(SDA)族に属し、インデックスの最大化ではなく、腕同士のペアワイズ比較(デュエル)を用いて行動を選択する。
  • アルゴリズムはランダムブロック(RB)サブサンプリングを採用しており、各腕の報酬をブロックに分け、その中からランダムに1つのブロックを選択して比較する。
  • サブサンプリングは、プル回数の多い腕の有効サンプルサイズを低減することで、未十分にサンプリングされた腕の探索を促進する。
  • この手法は、サブサンプリングが最適でない腕に偏向しないように保証する一般化されたバランス条件に依存する。
  • 強制的探索は、$ f_r / \log\log r \to \infty $ を満たす列 $ f_r $ を用いて導入され、指数型分布族において一般化されたバランス条件が成立することを保証する。
  • 理論的分析では、カルバック・ライブラー発散とi.i.d.確率変数の和の尾部バウンドを用いて、誤ったデュエルが生じる確率を制御する。

実験結果

リサーチクエスチョン

  • RQ1再サンプリングに基づくバンディットアルゴリズムは、分布に特化したチューニングを必要とせずに、複数の分布族にわたって漸近的に最適なリグレットを達成できるか?
  • RQ2デュエルリングフレームワーク内でランダムブロックサブサンプリングを用いることで、対数的リグレットと漸近的最適性が維持されるか?
  • RQ31パラメータ指数型分布族において、一般化されたバランス条件が成立する探索レート $ f_r $ の条件は何か?
  • RQ4強制的探索を用いることで、非有界またはパラメトリックな分布に対してSDAアルゴリズムの漸近的最適性を保証できるか?
  • RQ5RB-SDAは、非パラメトリックTSやGIROといった既存の非パラメトリックアルゴリズムと比較して、リグレットとロバストネスの面でどのように異なるか?

主な発見

  • RB-SDAは、ベルヌーイ、ガウス、ポアソン分布を含む、腕の分布に関する一般条件のもとで対数的リグレットを達成する。
  • 1パラメータ指数型分布族において、強制的探索レート $ f_r = \sqrt{\log r} $ を用いたRB-SDAは、一般化されたバランス条件を満たし、漸近的最適性を保証する。
  • RB-SDAのリグレットは、1パラメータ指数型分布族に対してLai-Robbinsの下界に一致し、これが漸近的に最適であることを証明する。
  • トムソンサンプリングとは異なり、分布族の事前指定を必要とせず、分布に特化したチューニングが不要である。
  • 一般化されたバランス条件は $ f_r / \log\log r \to \infty $ のとき成立し、これは $ f_r = \sqrt{\log r} $ によって満たされるため、理論的保証が得られる。
  • 実験結果は、チューニングなしで異なる分布設定においても、RB-SDAのロバストネスと柔軟性を確認する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。