Skip to main content
QUICK REVIEW

[論文レビュー] Doubly-Robust Lasso Bandit

Gi-Soo Kim, Myunghee Cho Paik|arXiv (Cornell University)|Jul 26, 2019
Advanced Bandit Algorithms Research参考文献 30被引用数 12
ひとこと要約

本稿では、Lassoによるスパース回帰と二重にロバストな推定を組み合わせることで、観測されないアームの文脈を活用する、文脈付き多腕バンディットアルゴリズム「Doubly-Robust Lasso Bandit」を提案する。高い確率でのレギュレートバウンドとして $ O(s_0 \log(dT)\sqrt{T}) $ を達成し、次元 $ d $ に対して対数的にスケーリングされ、アーム数に依存しない。

ABSTRACT

Contextual multi-armed bandit algorithms are widely used in sequential decision tasks such as news article recommendation systems, web page ad placement algorithms, and mobile health. Most of the existing algorithms have regret proportional to a polynomial function of the context dimension, $d$. In many applications however, it is often the case that contexts are high-dimensional with only a sparse subset of size $s_0 (\ll d)$ being correlated with the reward. We consider the stochastic linear contextual bandit problem and propose a novel algorithm, namely the Doubly-Robust Lasso Bandit algorithm, which exploits the sparse structure of the regression parameter as in Lasso, while blending the doubly-robust technique used in missing data literature. The high-probability upper bound of the regret incurred by the proposed algorithm does not depend on the number of arms and scales with $\mathrm{log}(d)$ instead of a polynomial function of $d$. The proposed algorithm shows good performance when contexts of different arms are correlated and requires less tuning parameters than existing methods.

研究の動機と目的

  • 高次元の文脈次元 $ d $ に対してレギュレートが多項式的にスケーリングされる既存の文脈付きバンディットアルゴリズムの限界に対処する。特に、関連する特徴量のスパースサブセット $ s_0 \ll d $ のみが影響を及ぼす場合に有効であることを目的とする。
  • バンディットにおけるアダプティブサンプリング下でLasso推定が非整合的になる課題を、バンディットの既知のアーム選択メカニズムを活用することで克服する。
  • 欠損データの文献から取り入れた二重にロバストな推定を用いて、選択されなかったアームの未観測報酬(欠損)を活用し、データ効率を向上させる。
  • アーム数 $ N $ に依存しないレギュレートバウンドを構築することで、推薦システムのような動的または大規模なアーム集合に適したアルゴリズムを実現する。
  • スパarsityとモデル不適合へのロバスト性を組み合わせることで、従来のLassoベースのバンディット手法よりもタイトなレギュレートバウンドを達成する。

提案手法

  • 共通の回帰パラメータ $ \beta \in \mathbb{R}^d $ を持つ確率的線形文脈付きバンディット問題を定式化し、報酬が文脈ベクトル $ b_i(t) $ に対して線形に依存するものとする。
  • スパース性を強制するためにLasso推定を適用し、報酬に影響する特徴量は $ s_0 $ 個に限ると仮定する。
  • 結果の回帰と感受性スコアを組み合わせることで、選択されなかったアームの不偏な疑似報酬を構築する二重にロバストな推定を用いる。
  • 未知の文脈を活用できるように、二重にロバスト推定器に既知のアーム選択確率(欠損メカニズム)を組み込む。
  • 適合性条件の下で、再帰的集中不等式を用いて推定誤差 $ \|\hat{\beta}(t) - \beta\|_1 $ の高確率的信頼区間を構築する。
  • 二重にロバストなLasso推定器から導かれる信頼区間を用いたUCBスタイルのアルゴリズムを設計し、推定された期待報酬に基づいてアームを選択する。

実験結果

リサーチクエスチョン

  • RQ1高次元の文脈付きバンディットでスパース報酬構造を持つ場合、次元 $ d $ に対して多項式ではなく $ \log(d) $ に依存するレギュレートバウンドを達成できるか?
  • RQ2適応的バンディット設定において、選択されなかったアームからの未観測文脈を効果的に活用することで、パラメータ推定を改善できるか?
  • RQ3欠損データの文献から得た二重にロバストな技術を、欠損メカニズムが学習者が制御する文脈付きバンディットに適応できるか?
  • RQ4Lassoのスパarsityと二重にロバストな推定を組み合わせることで、標準のLassoバンディット手法に比べてより良いレギュレート性能とチューニング感度の低減が達成できるか?
  • RQ5特に動的または大規模なアーム環境において、レギュレートバウンドがアーム数 $ N $ に依存しないか?

主な発見

  • 提案されたDoubly-Robust Lasso Banditは、高確率でのレギュレート上界として $ O(s_0 \log(dT)\sqrt{T}) $ を達成し、次元 $ d $ に対して多項式ではなく $ \log(d) $ に依存する。
  • レギュレートバウンドはアーム数 $ N $ に依存しないため、動的または大規模なアーム集合にスケーラブルである。
  • シミュレーションでは、アーム数が増加する場合や文脈相関が強い場合に、DR Lasso Banditが標準Lasso Banditを上回る性能を示す。
  • Lasso Banditのレギュレートは $ N $ に伴い増加するが、DR Lasso Banditの性能は $ N $ の変化に対してロバストであるため、スケーラビリティが裏付けられる。
  • 特に二重にロバスト推定器の安定性のおかげで、既存手法に比べてチューニングパラメータへの感受性が低く抑えられている。
  • 推定誤差がしきい値を超えるラウンドの部分集合が高確率で空集合であることが示され、信頼区間のタイトさが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。