Skip to main content
QUICK REVIEW

[論文レビュー] Semiparametric Contextual Bandits

Akshay Krishnamurthy, Zhiwei Steven Wu|arXiv (Cornell University)|Mar 12, 2018
Advanced Bandit Algorithms Research参考文献 24被引用数 13
ひとこと要約

本稿は、報酬を行動特徴の線形関数と非線形で行動に依存しない交絡要因の和としてモデル化する、新しい半パラメトリックな文脈的バンディットアルゴリズムを提案する。二重にロバストな報酬推定器と、新たな確率的探索戦略を活用することで、線形バンディットにおける最良の境界と一致する $ ilde{O}(dackslashsqrt{T})$ のレグレットを達成する。非線形な交絡効果に対してもロバストであり、交わされた報酬を持つ実験的評価において、先行手法を上回る性能を発揮する。

ABSTRACT

This paper studies semiparametric contextual bandits, a generalization of the linear stochastic bandit problem where the reward for an action is modeled as a linear function of known action features confounded by an non-linear action-independent term. We design new algorithms that achieve $ ilde{O}(d\sqrt{T})$ regret over $T$ rounds, when the linear function is $d$-dimensional, which matches the best known bounds for the simpler unconfounded case and improves on a recent result of Greenewald et al. (2017). Via an empirical evaluation, we show that our algorithms outperform prior approaches when there are non-linear confounding effects on the rewards. Technically, our algorithms use a new reward estimator inspired by doubly-robust approaches and our proofs require new concentration inequalities for self-normalized martingales.

研究の動機と目的

  • パラメトリックバンディット(効率的だがモデル誤指定に敏感)とアグノスティックバンディット(ロバストだが統計的に非効率)の間のギャップを埋めること。
  • 報酬に非線形で行動に依存しない交絡要因が存在する状況でも、パラメトリック手法の統計的効率を維持しながら、それらの交絡要因に対してロバストである文脈的バンディットアルゴリズムを設計すること。
  • 交絡要因が存在する中でも、線形ステochasticバンディットの最適な $ ilde{O}(dackslashsqrt{T})$ の率と一致するレグレット境界を達成すること。
  • 半パラメトリックな仮定下で一貫性とレグレット制御を保証する、新しい推定器とアルゴリズムフレームワークを開発すること。

提案手法

  • 非線形交絡要因を伴う線形モデルに対する新しい二重にロバストな報酬推定器を提案。半パラメトリック統計とエコノメトリクスの手法を応用する。
  • 行動除去にインspiredされた確率的探索アルゴリズムを導入。文脈的バンディット設定に適応させ、一貫性のある推定を保証する。
  • de la Peña らの手法を用いて、ベクトル値過程に対する自己正規化マルティングルの集中不等式を導出。推定誤差を制御する。
  • 時間的に変化する正則化パrameter $ackslashgamma(T)$ を用いた線形パrameter $ackslashtheta$ の信頼集合を採用。敵対的特徴および交絡要因列に対してもロバスト性を確保する。
  • フィルトレーションに基づくレグレットの分解を用い、推定誤差と探索と活用のトレードオフを分離する。
  • アズマの不等式とマルティングルの偏差に対するフレドマンの不等式を組み合わせることで、高確率でのレグレット境界を導出する。

実験結果

リサーチクエスチョン

  • RQ1報酬が非線形で行動に依存しない項によって交絡される状況下でも、文脈的バンディットで最適な $ ilde{O}(dackslashsqrt{T})$ レグレットを達成できるか?
  • RQ2交絡によるモデル誤指定に対するロバスト性を獲得しつつ、パラメトリックバンディットの統計的効率を維持することは可能か?
  • RQ3報酬関数全体の線形性を仮定しない状況下で、交絡要因が存在する中でも線形パrameterの一貫性のある推定器を設計できるか?
  • RQ4交わされた報酬を持つ半パラメトリックバンディット設定において、確率的探索戦略が楽観主義に基づく手法を上回ることができるか?
  • RQ5適応的でバンディットフィードバック設定における半パラメトリック推定器の分析に必要な、新たな集中不等式は何か?

主な発見

  • 提案されたアルゴリズムは $T$ ラウンドで $ ilde{O}(dackslashsqrt{T})$ のレグレットを達成し、線形確率的バンディットにおける最良の境界と一致する。
  • 特徴量と交絡要因が適応的敵対的選択を受けても、このレグレット境界は成立し、強いロバスト性を示す。
  • 実験的評価では、交絡効果が存在する状況で、パラメトリックおよびアグノスティックベースラインを著しく上回る性能を発揮する。
  • 交絡がない状況では、パラメトリックベースラインよりわずかに劣るが、依然として効果的な性能を維持する。
  • 理論的分析において、ベクトル値過程に対する新しい自己正規化マルティングル不等式を導入し、より緊密な集中境界を可能にする。
  • 二重にロバストな推定器により、交絡要因モデルが誤指定であっても、線形パrameter $ackslashtheta$ の一貫性のある推定が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。