Skip to main content
QUICK REVIEW

[論文レビュー] Rebounding Bandits for Modeling Satiation Effects

Liu Leqi, Fatma Kılınç-Karzan|arXiv (Cornell University)|Nov 13, 2020
Advanced Bandit Algorithms Research参考文献 44被引用数 9
ひとこと要約

本稿では、時間に依存しない線形力学系を用いて、繰り返しの選択によるユーザーの満足度の低下と、選択されない間の回復をモデル化する、リバウンド・バンディッツと呼ばれるマルチアームバンディット枠組みを提案する。報酬は繰り返しの選択に伴い低下し、選択されない間は回復する。提案されたExplore-Estimate-Plan(EEP)アルゴリズムは、体系的な探索、動的特性の推定、学習したパラメータを用いた計画によって、wステップ先読みのレギュレートをサブライン形式で達成する。

ABSTRACT

Psychological research shows that enjoyment of many goods is subject to satiation, with short-term satisfaction declining after repeated exposures to the same item. Nevertheless, proposed algorithms for powering recommender systems seldom model these dynamics, instead proceeding as though user preferences were fixed in time. In this work, we introduce rebounding bandits, a multi-armed bandit setup, where satiation dynamics are modeled as time-invariant linear dynamical systems. Expected rewards for each arm decline monotonically with consecutive exposures to it and rebound towards the initial reward whenever that arm is not pulled. Unlike classical bandit settings, methods for tackling rebounding bandits must plan ahead and model-based methods rely on estimating the parameters of the satiation dynamics. We characterize the planning problem, showing that the greedy policy is optimal when the arms exhibit identical deterministic dynamics. To address stochastic satiation dynamics with unknown parameters, we propose Explore-Estimate-Plan (EEP), an algorithm that pulls arms methodically, estimates the system dynamics, and then plans accordingly.

研究の動機と目的

  • 満足度効果による動的ユーザー嗜好の変化を正しくモデル化できない推薦システムのギャップを埋める。
  • マルチアームバンディット設定において、時間に依存しない線形力学系として満足度を形式化する。
  • 繰り返しの露出による変化する報酬動態に適応し、先読み計画を行う手法を開発する。
  • 未知の確率的満足度動態におけるレギュレートとパラメータ推定の理論的保証を提供する。
  • 実験的評価を通じて、提案されたアルゴリズムの有効性を示す。

提案手法

  • 各アームの報酬が連続的な選択回数および最後に選択されてからの時間に基づいて変化する、線形力学系として定式化されたリバウンド・バンディッツフレームワークを提案する。
  • 繰り返しの選択による報酬低下と、アイドル状態での回復を、決定論的または確率的線形系としてモデル化する。
  • 最初に各アームを探索してデータを収集し、次に動的特性を推定し、最後に推定モデルを用いて計画する、Explore-Estimate-Plan(EEP)アルゴリズムを導入する。
  • 1つの軌道からアフィン力学系を推定し、パラメータ同定のためのサンプル複雑度の上限を提供する。
  • 状態空間のスケーリングがホライズン T に対して指数関数的に増加するマルコフ決定過程(MDP)において、wステップ先読み計画を採用する。
  • 報酬および遷移モデル推定の誤差項を用いてレギュレートを上限付けし、サブライン形式のwステップ先読みレギュレートを示す。

実験結果

リサーチクエスチョン

  • RQ1マルチアームバンディット枠組みは、ユーザーの満足度の低下と、不活性化後の報酬回復を効果的にモデル化できるか?
  • RQ2アームが同一の決定論的満足度動態を持つ場合、グリーディ方策は最適か?
  • RQ31つの相互作用軌道から、未知の確率的満足度動態を正確に推定できるか?
  • RQ4EEPアルゴリズムは、未知の動態が存在する状況でもサブライン形式のレギュレートを達成できるか?
  • RQ5先読み計画は、グリーディーや非計画的戦略と比較して、性能をどのように向上させるか?

主な発見

  • すべてのアームが同一の決定論的満足度動態を持つ場合、最適戦略は固定順序でアームを巡回することであるため、グリーディ方策が最適である。
  • EEPアルゴリズムは、適切な推定誤差条件のもとで、サブライン形式のwステップ先読みレギュレートを達成し、レギュレートがO(T²/√n)で上限付けされる。
  • アフィン力学系の推定器は、観測数およびシステム次元に比例するサンプル複雑度の上限を達成する。
  • 実験では、wステップ先読み方策が、計算時間の大幅な削減にもかかわらず、Tステップ先読み方策と同等の累積期待報酬を達成することが示された。
  • 24時間以内に解けるTステップ先読み方策の最適性ギャップの上限は13.0%(絶対ギャップ64.0)であり、実用的性能が非常に高いことが示された。
  • レギュレートの対数-対数プロットでは、EEPのwステップ先読みレギュレートがホライズンTに対してサブライン形式にスケーリングされることを確認し、理論的レギュレート上限を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。