Skip to main content
QUICK REVIEW

[論文レビュー] Taking a hint: How to leverage loss predictors in contextual bandits?

Chen-Yu Wei, Haipeng Luo|arXiv (Cornell University)|Mar 4, 2020
Advanced Bandit Algorithms Research参考文献 29被引用数 5
ひとこと要約

本稿は損失予測子を備えた文脈的バンディットを研究し、予測誤差総和 𝔈 が小さい場合、リグレットを顕著に低減できることを示している。予測子を活用する新規アルゴリズムを提案し、known 𝔈 の場合に最適なリグレットバウンド 𝒪(√𝔼𝑇¹/⁴) と、unknown 𝔈 の場合に 𝒪(√𝔼𝑇¹/³) を達成した。また、非文脈的設定とは異なり、複数の予測子では M に対して線形依存が生じることを明らかにした。

ABSTRACT

We initiate the study of learning in contextual bandits with the help of loss predictors. The main question we address is whether one can improve over the minimax regret $\mathcal{O}(\sqrt{T})$ for learning over $T$ rounds, when the total error of the predictor $\mathcal{E} \leq T$ is relatively small. We provide a complete answer to this question, including upper and lower bounds for various settings: adversarial versus stochastic environments, known versus unknown $\mathcal{E}$, and single versus multiple predictors. We show several surprising results, such as 1) the optimal regret is $\mathcal{O}(\min\{\sqrt{T}, \sqrt{\mathcal{E}}T^\frac{1}{4}\})$ when $\mathcal{E}$ is known, a sharp contrast to the standard and better bound $\mathcal{O}(\sqrt{\mathcal{E}})$ for non-contextual problems (such as multi-armed bandits); 2) the same bound cannot be achieved if $\mathcal{E}$ is unknown, but as a remedy, $\mathcal{O}(\sqrt{\mathcal{E}}T^\frac{1}{3})$ is achievable; 3) with $M$ predictors, a linear dependence on $M$ is necessary, even if logarithmic dependence is possible for non-contextual problems. We also develop several novel algorithmic techniques to achieve matching upper bounds, including 1) a key action remapping technique for optimal regret with known $\mathcal{E}$, 2) implementing Catoni's robust mean estimator efficiently via an ERM oracle leading to an efficient algorithm in the stochastic setting with optimal regret, 3) constructing an underestimator for $\mathcal{E}$ via estimating the histogram with bins of exponentially increasing size for the stochastic setting with unknown $\mathcal{E}$, and 4) a self-referential scheme for learning with multiple predictors, all of which might be of independent interest.

研究の動機と目的

  • 損失予測子が、標準的な 𝒪(√T) のミニマックスバウンドを上回る文脈的バンディットにおけるリグレットの改善を可能にするかを調査すること。
  • 予測誤差総和 𝔈 が既知または未知である場合の最適なリグレットバウンドを特定すること。
  • 予測子の数 M がリグレットに与える影響、特に M に対する依存関係を分析すること。
  • 敵対的および確率的設定の両方で、これらの改善されたリグレットバウンドを達成する効率的なアルゴリズムを開発すること。
  • 文脈的バンディットと非文脈的問題(例:マルチアームドバンディット)との間で、損失予測子を活用する点における根本的な違いを理解すること。

提案手法

  • known 𝔈 の場合に最適なリグレットを達成するための新規なアクション再マッピング技術を導入し、予測品質のより良い活用を可能にする。
  • 確率的設定において、Catoni のロバスト平均推定器を ERM オракルを用いて計算効率の良い形で実装し、最適なリグレットを達成する。
  • 確率的環境で unknown 𝔈 を扱うために、指数関数的に増加するビンサイズを用いたヒストグラム推定を用いた 𝔈 のアンダーセティマッパーを提案する。
  • 複数の予測子を用いた学習のための自己参照的スキームを構築し、M 個のソースからの予測を適応的に統合可能にする。
  • 予測の信頼性に基づいて動的に探索を調整する予算ベースのメカニズムを採用し、予測精度とロバストネスのバランスを取る。
  • 敵対的および i.i.d. 設定の両方でリグレットをバウンドするため、予測誤差と信頼区間の階層的分析を用いる。

実験結果

リサーチクエスチョン

  • RQ1損失予測子は、標準的な 𝒪(√T) のミニマックスバウンドを上回る文脈的バンディットにおけるリグレットを低減できるか?
  • RQ2予測誤差総和 𝔈 が既知である場合の最適なリグレットバウンドは何か? また、非文脈的設定と比較してどうなるか?
  • RQ3予測誤差総和 𝔈 が未知である場合、リグレットバウンドはどのように変化するか? また、非線形リグレットを達成できるか?
  • RQ4予測子の数 M がリグレットに与える影響は何か? また、文脈的バンディットにおいて M に対して対数的依存が可能か?
  • RQ5計算オーバーヘッドを最小限に抑えつつ、最適なリグレットを達成する効率的なアルゴリズムを設計できるか?

主な発見

  • known 𝔈 の場合、最適なリグレットは 𝒪(min{√T, √𝔼𝑇¹/⁴}) であり、マルチアームドバンディットなどの非文脈的問題における 𝒪(√𝔼) バウンドよりも厳密に悪い。
  • unknown 𝔈 の場合、バウンド 𝒪(√𝔼𝑇¹/⁴) は達成不可能である。代わりに、達成可能な最良のリグレットは 𝒪(√𝔼𝑇¹/³) であり、𝔼 = o(T¹/³) であれば依然として非線形である。
  • M 個の予測子に対して、known 𝔈* の場合の最適なリグレットは 𝒪(√(M𝔼*)𝑇¹/⁴) であり、非文脈的設定とは異なり M に対して線形依存が生じる。
  • unknown 𝔈* の場合、最適なリグレットは 𝒪(M²/³(𝔼*T)¹/³) であり、予測子の数と予測誤差の間で非自明なトレードオフが生じる。
  • 提案されたアルゴリズムは、すべての設定で一致する上界を達成しており、アクション再マッピングや 𝔈 のロバストなヒストグラムベースのアンダーセティメーションといった新規技術を用いている。
  • 結果として、タイトな下界が確立され、与えられた仮定の下で導出されたリグレットバウンドが情報理論的に最適であることが証明された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。