Skip to main content
QUICK REVIEW

[論文レビュー] Contextual Multi-armed Bandit Algorithm for Semiparametric Reward Model

Gi-Soo Kim, Myunghee Cho Paik|arXiv (Cornell University)|Jan 31, 2019
Advanced Bandit Algorithms Research被引用数 6
ひとこと要約

本稿では、時間に依存するベースライン報酬を許容する半パラメトリック報酬モデルに対する、文脈的マルチアームバンディットアルゴリズムの新規提案を行う。強いパラメトリック仮定を必要とせず、重み付き文脈センタリングと新しいマルティングルの不等式を用いることで、線形モデル下でのスミス・サンプリングと同等のオーダーのレグレットバウンドを達成するとともに、計算効率が良く、同様の非定常モデルに対して既存の手法よりも実装が簡単である。

ABSTRACT

Contextual multi-armed bandit (MAB) algorithms have been shown promising for maximizing cumulative rewards in sequential decision tasks such as news article recommendation systems, web page ad placement algorithms, and mobile health. However, most of the proposed contextual MAB algorithms assume linear relationships between the reward and the context of the action. This paper proposes a new contextual MAB algorithm for a relaxed, semiparametric reward model that supports nonstationarity. The proposed method is less restrictive, easier to implement and faster than two alternative algorithms that consider the same model, while achieving a tight regret upper bound. We prove that the high-probability upper bound of the regret incurred by the proposed algorithm has the same order as the Thompson sampling algorithm for linear reward models. The proposed and existing algorithms are evaluated via simulation and also applied to Yahoo! news article recommendation log data.

研究の動機と目的

  • 文脈と報酬の間の時間に依存しない線形関係を仮定する既存の文脈的MABアルゴリズムの制限を解決すること。
  • 時間に依存する切片項を有する半パラメトリックモデルを用いて、非定常な報酬メカニズムをサポートする手法を開発すること。
  • 同様の非定常モデル下で、既存のアルゴリズムと比較して計算効率と実装の簡便性を向上させること。
  • 線形モデル下でのスミス・サンプリングと同等のオーダーの高確率レグレット上界を確立すること。
  • 調整パrameterを必要としない一貫性のある推定量を提供し、既存の推定量よりも収束速度を速くすること。

提案手法

  • 半パラメトリックモデルにおける回帰パrameterの一貫性推定のため、文脈ベクトルの重み付きセンタリングを用いる。
  • 新しいマルティングルの不等式を適用し、提案アルゴリズムの高確率レグレット上界を導出する。
  • スミス・サンプリングにインspiredされた行動選択戦略を採用し、任意の数のアームに対して明示的な確率分布を定義する。
  • 各イテレーションでO(N)の計算量で実行可能な計算効率の良いアルゴリズムを実装し、行動削除法のO(N²)コストを回避する。
  • Liら(2011)のオフライン評価手法を用いて、観測ログデータから累積報酬を推定する。
  • Yahoo! R6Aデータセットからの検証データに基づき、調整パrameter選択手順を採用する。

実験結果

リサーチクエスチョン

  • RQ1非定常な報酬を持つ半パラメトリックモデルに対して、計算効率が良くかつ実装が簡単な文脈的MABアルゴリズムを開発できるか?
  • RQ2パラメトリック仮定を緩和しても、線形モデル下でのスミス・サンプリングと同等のオーダーのレグレットバウンドを達成できるか?
  • RQ3非定常な報酬条件下で、累積報酬と学習速度の観点から、既存のアルゴリズムと比較してどのように差がつくか?
  • RQ4調整パrameterを追加で必要としないにもかかわらず、回帰パrameterの推定量が既存の推定量よりも速く収束するか?
  • RQ5観測ログデータを用いた実世界の応用、例えばニュース記事推薦において、既存のアルゴリズムを上回る性能を示せるか?

主な発見

  • 提案手法は、より一般的な半パラメトリックモデルを用いるにもかかわらず、線形モデル下でのスミス・サンプリングと同等のオーダーの高確率レグレット上界を達成した。
  • シミュレーション研究において、特にベースライン報酬が時間とともに変化する状況下で、既存手法と比較して一貫して低い累積レグレットを達成した。
  • Yahoo! R6Aデータセットでは、10回の実行平均でクリックレート90,689.7を達成し、元のスミス・サンプリングアルゴリズムと比較して4.4%の改善を示した。
  • ACTSアルゴリズムよりも高速な学習速度を示し、BOSEと同等の性能を示したが、BOSEはN > 2の場合に明示的な行動選択法を欠いていた。
  • 回帰パrameterの推定量は、既存の推定量よりも速い収束を示し、追加の調整パrameterを必要としなかった。
  • 異なるアーム数(N=2およびN=6)の状況下でも、時間に依存する切片を有する条件下で、強力なレグレット性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。