Skip to main content
QUICK REVIEW

[論文レビュー] Latent Bandits Revisited

Joey Hong, Branislav Kveton|arXiv (Cornell University)|Jun 15, 2020
Advanced Bandit Algorithms Research参考文献 29被引用数 11
ひとこと要約

本稿では、モデルの不確実性や誤指定を明示的に取り入れる文脈付きUCBおよびトマソンサンプリングアルゴリズムを提案し、潜在的状態の特定をより高速かつより強固に行う。潜在的状態の数が行動の数未満である場合、従来のバンディット方策よりも低いレグレットを達成しており、合成データおよびMovieLens 1Mデータセットで検証され、平均的および最悪ケースのユーザー状況において優れた性能を示した。

ABSTRACT

A latent bandit problem is one in which the learning agent knows the arm reward distributions conditioned on an unknown discrete latent state. The primary goal of the agent is to identify the latent state, after which it can act optimally. This setting is a natural midpoint between online and offline learning---complex models can be learned offline with the agent identifying latent state online---of practical relevance in, say, recommender systems. In this work, we propose general algorithms for this setting, based on both upper confidence bounds (UCBs) and Thompson sampling. Our methods are contextual and aware of model uncertainty and misspecification. We provide a unified theoretical analysis of our algorithms, which have lower regret than classic bandit policies when the number of latent states is smaller than actions. A comprehensive empirical study showcases the advantages of our approach.

研究の動機と目的

  • ユーザーの意図や好みが観測不能であるが報酬に影響を与えるオンライン学習の文脈において、潜在的状態の同定という課題に対処すること。
  • オフライン学習された報酬モデルの不確実性や誤指定に対して頑健な、文脈付きバンディットアルゴリズムを設計すること。
  • 潜在的バンディットフレームワークにおけるUCBとトマソンサンプリングの理論的分析を統一し、保証可能なレグレットバウンドを導出すること。
  • 特にコールドスタートおよび最悪ケースのパーソナライゼーション状況において、最先端のベースラインを上回る実験的優位性を示すこと。

提案手法

  • 行動ではなく潜在的状態の上に信頼区間を維持する、新しい文脈付きUCBアルゴリズムを提案。オフライン学習されたモデルパラメータの不確実性を組み込む。
  • 潜在的状態の事後分布からサンプリングするトマソンサンプリングの変種を導入。オフライン推定されたモデルパラメータを中心とするガウス事前分布を用い、経験的共分散を不確実性の定量化に活用。
  • UCBと事後サンプリングの緊密な関係を活用し、サブガウス報酬仮定の下で統一的な理論的レグレットバウンドを導出。
  • UCBとTSの両方を統一的な枠組みで分析することで、理論的比較とモデル誤指定下での頑健性保証を可能にする。
  • 低ランク行列分解モデルを用いてユーザおよびアイテムの表現を推定。履歴データのオフライン学習により、潜在的状態および報酬モデルを初期化。
  • 今後の研究において、非定常的潜在的状態ダイナミクスへの対応のため、割引およびスライディングウインドウ技術を適用。

実験結果

リサーチクエスチョン

  • RQ1UCBおよびトマソンサンプリングは、オフライン学習されたモデルパラメータの不確実性を明示的に扱うために、潜在的バンディット設定に適応可能か?
  • RQ2潜在的状態の数が行動の数未満である場合、不確実性に配慮したアルゴリズムのレグレット性能は、従来のバンディット方策と比べてどのように異なるか?
  • RQ3提案されたアルゴリズムは、コールドスタートおよび最悪ケースのユーザーサイチュエーションにおいて、パーソナライゼーションの速度と頑健性をどの程度向上させるか?
  • RQ4潜在的バンディットフレームワークにおいて、UCBとトマソンサンプリングの両方の理論的分析を統一的に開発可能か?

主な発見

  • 提案されたmmTSアルゴリズムは、MovieLens 1Mデータセットにおける平均的および最悪ケースのユーザーパフォーマンスにおいて、mTSおよびLinTSを上回り、平均評価点が顕著に高い水準に達した。
  • mmTSは、完全な映画ベクトル情報が利用可能であっても、EXP4やLinUCBよりもより高い長期的報酬に収束した。
  • 最悪の10%のユーザーにおいて、mmTSはmTSよりも顕著に高い平均評価点を達成し、モデル誤指定に対する頑健性を示した。
  • 潜在的状態の数が行動の数未満である場合、提案されたアルゴリズムの理論的レグレットバウンドは、従来のバンディット方策のそれよりも低かった。
  • 実験的結果から、モデルの不確実性を考慮することで、特にコールドスタート状況において、潜在的状態の特定がより高速かつ信頼性高く実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。