Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Bandits with Delay-Dependent Payoffs

Leonardo Cella, Nicolò Cesa‐Bianchi|arXiv (Cornell University)|Oct 7, 2019
Advanced Bandit Algorithms Research参考文献 23被引用数 4
ひとこと要約

本稿では、音楽推薦システムを動機として、アームの期待報酬が最後に引かれてからの時間に応じて増加する非定常確率的バンディットモデルB2DEPを導入する。報酬の増加は、最後に引かれてからの経過ラウンド数に依存する。本稿では、ベースライン報酬に基づいて上位のアームを順に巡回するランク付けポリシーのクラスを提案し、そのレグレットバウンドを$ otimes\mathcal{O}}(\sqrt{kT})$、スイッチ回数を$ olimits\mathcal{O}}(k\ln\ln T)$ に抑え、最適ポリシーの定数倍以内に近づくことを証明する。

ABSTRACT

Motivated by recommendation problems in music streaming platforms, we propose a nonstationary stochastic bandit model in which the expected reward of an arm depends on the number of rounds that have passed since the arm was last pulled. After proving that finding an optimal policy is NP-hard even when all model parameters are known, we introduce a class of ranking policies provably approximating, to within a constant factor, the expected reward of the optimal policy. We show an algorithm whose regret with respect to the best ranking policy is bounded by $\widetilde{\mathcal{O}}\big(\!\sqrt{kT}\big)$, where $k$ is the number of arms and $T$ is time. Our algorithm uses only $\mathcal{O}\big(k\ln\ln T\big)$ switches, which helps when switching between policies is costly. As constructing the class of learning policies requires ordering the arms according to their expectations, we also bound the number of pulls required to do so. Finally, we run experiments to compare our algorithm against UCB on different problem instances.

研究の動機と目的

  • 音楽ストリーミングプラットフォームなどの実世界の推薦システムにおいて、同じコンテンツを繰り返し提示するとユーザーの関与度が低下するため、非定常バンディットモデルの必要性を動機づける。
  • 報酬が最後に引かれてからの時間に依存する非定常環境において最適ポリシーを学ぶ課題に取り組み、これはNP困難であることが示されている。
  • ベースライン報酬の順に上位$r$個のアームを巡回するという制限付きのランク付けポリシーのクラスを提案し、その期待報酬が最適ポリシーの定数倍以内に抑えられることを証明する。
  • 最適ランク付けポリシーに対するレグレットを最小化すると同時に、実際の運用でコストがかかるポリシーのスイッチ回数を制御する学習アルゴリズムを設計する。
  • 実験により、本稿で提案するアルゴリズムが、特にサブオプティマルギャップが小さい状況において、標準的なUCBよりもスイッチングコストを考慮した設定で優れていることを示す。

提案手法

  • 各アーム$i$がベースライン報酬$\mu_i$と遅延パラメータ$d_i$を持つB2DEPモデルを形式化する。ここで、期待報酬$\mu_i(\tau)$は、最後に引かれてからの経過ラウンド数$\tau$に応じて増加し、$\tau > d_i$ になると$\mu_i$に安定する。
  • ベースライン報酬$\mu_i$の順に上位$r$個のアームを巡回するランク付けポリシーのクラス$\Pi_{\mathcal{K}}$を導入し、このクラスが最適ポリシーの定数倍以内に近づくことを証明する。
  • UCB1に基づく学習アルゴリズムを設計し、報酬推定に各ポリシーの2回目の実行結果のみを用いるように変更することで、過去のポリシー履歴によるバイアスを低減し、補正を保証する。
  • 探索を制限し、スイッチを頻繁にしないようにする$\pi_{\mathrm{low}}$というバージョンを実装し、$\mathcal{O}(k\ln\ln T)$ のスイッチ回数を保証しながら、$\widetilde{\mathcal{O}}(\sqrt{kT})$ のレグレットバウンドを達成する。
  • 各ランク付けポリシーの期待報酬を推定するために、$\pi_{\mathrm{ghost}}$ と呼ばれるゴーストポリシーを用い、実験で最適ポリシーと比較可能にする。
  • 時間の長さ$T$を事前に知らない場合に備えて、ダブリングトリックや類似手法を適用し、時間枠の事前知識が不要となるようにする。

実験結果

リサーチクエスチョン

  • RQ1B2DEPモデルにおいて、すべてのパラメータが既知であっても、最適周期的ポリシーを求める問題はNP困難であるか?
  • RQ2上位$r$個のアームをベースライン報酬の順に巡回するという制限付きのランク付けポリシーのクラスは、最適ポリシーの期待報酬の定数倍以内に近づけるか?
  • RQ3最適ランク付けポリシーに対するサブ線形レグレットを達成すると同時に、ポリシーのスイッチ回数を最小化する学習アルゴリズムを設計できるか?
  • RQ4サブオプティマルギャップが小さい場合に、提案アルゴリズムの性能は標準UCBと比べて、レグレットとスイッチングコストの両面で優れているか?
  • RQ52つの良いポリシーの間をスイッチするほうが、1つの最適ポリシーに固定するよりも平均期待報酬が高くなる条件は何か? そして、これはレグレットにどのように影響するか?

主な発見

  • B2DEPモデルにおいて最適周期的ポリシーを求める問題は、すべてのモデルパラメータが既知であってもNP困難であることが示された。これは、周期的メンテナンススケジューリング問題への還元によって証明された。
  • ベースライン報酬の順に上位$r$個のアームを巡回するランク付けポリシーのクラスは、最適ポリシーの報酬の定数倍以内の期待報酬を達成する。
  • 提案された学習アルゴリズムは、最適ランク付けポリシーに対するレグレットバウンドを$\widetilde{\mathcal{O}}(\sqrt{kT})$ に抑え、ここで$k$はアームの数、$T$は時間枠である。
  • ポリシーのスイッチ回数は$\mathcal{O}(k\ln\ln T)$ に抑えられており、これはスイッチがコストがかかる状況で有益である。
  • 実験により、スイッチを制限する$\pi_{\mathrm{low}}$ が、スイッチングコストが存在する状況でUCBを上回ることを示した。特にサブオプティマルギャップが小さい場合に顕著であった。
  • 事実1は、2つのランク付けポリシーが同程度に最適である場合、それらの間をスイッチすることで、片方のポリシーを単独で使用するよりも高い平均期待報酬が得られることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。