Skip to main content
QUICK REVIEW

[論文レビュー] Multi-facet Contextual Bandits: A Neural Network Perspective

Yikun Ban, Jingrui He|arXiv (Cornell University)|Jun 6, 2021
Advanced Bandit Algorithms Research参考文献 44被引用数 4
ひとこと要約

この論文では、複数のバンディットの報酬関数を統合的にモデル化して最終的な複合報酬を最大化するニューラルネットワークベースのアルゴリズム、MuFasaを紹介する。探索には上位信頼区間(UCB)を活用し、相互に依存するバンディット間の関係を捉えるために共有ニューラルネットワークを用いる。その結果、$ otimes ilde{ mathcal{O}}((K+1) sqrt{T})$ の近似的に最適なレグレットバウンドを達成し、部分的なサブ報酬の利用可能性がある状況下でも、実世界のデータセットにおいて強力なベースラインを上回る性能を示した。

ABSTRACT

Contextual multi-armed bandit has shown to be an effective tool in recommender systems. In this paper, we study a novel problem of multi-facet bandits involving a group of bandits, each characterizing the users' needs from one unique aspect. In each round, for the given user, we need to select one arm from each bandit, such that the combination of all arms maximizes the final reward. This problem can find immediate applications in E-commerce, healthcare, etc. To address this problem, we propose a novel algorithm, named MuFasa, which utilizes an assembled neural network to jointly learn the underlying reward functions of multiple bandits. It estimates an Upper Confidence Bound (UCB) linked with the expected reward to balance between exploitation and exploration. Under mild assumptions, we provide the regret analysis of MuFasa. It can achieve the near-optimal $\widetilde{ \mathcal{O}}((K+1)\sqrt{T})$ regret bound where $K$ is the number of bandits and $T$ is the number of played rounds. Furthermore, we conduct extensive experiments to show that MuFasa outperforms strong baselines on real-world data sets.

研究の動機と目的

  • ユーザーのニーズが複数の相互に依存するフェイチャにまたがる個人化されたレコメンデーションや医療意思決定の課題に対処すること。
  • 各フェイチャが別個のバンディットに対応する新しいマルチフェイチャコンテキストバンドイット設定をモデル化すること。最終的な報酬はすべてのサブ報酬の関数として定義される。
  • 複数のバンディット間の依存関係を捉える共同学習フレームワークを構築し、探索と活用のバランスを取ること。
  • 非線形報酬関数と部分的なサブ報酬利用可能性が存在する状況下でも、近似的に最適なレグレットバウンドを達成すること。
  • さまざまな報酬利用可能性条件の下で、実世界のデータセットにおいてロバストな性能を示すこと。

提案手法

  • MuFasaは、サブ報酬と最終的な複合報酬の両方から、$K$ 個のバンディットの報酬関数を共同で推定するための共有ニューラルネットワーク $\mathcal{F}$ を採用する。
  • ニューラルネットワークからの不確実性推定を組み込んだ上位信頼区間(UCB)戦略を用い、探索と活用のバランスを取る。
  • 最終報酬を $K$ 個のサブ報酬の関数 $H$ としてモデル化することで、バンディットの成果間の複雑で非線形的な関係を学習可能となる。
  • サブ報酬の一部の利用可能性に耐性を持つように設計されており、最終報酬信号に依存するとともに、利用可能な場合にサブ報酬を個々のバンディットの特徴学習を強化するために活用する。
  • レグレット解析では、報酬関数のリプシッツ連続性と特徴空間の有界性といった弱い仮定を仮定し、$\widetilde{\mathcal{O}}((K+1)\sqrt{T})$ のレグレットバウンドを導出する。
  • 損失関数は予測された最終報酬と観測された最終報酬の差に基づき、確率的勾配降下法を用いてエンドツーエンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークベースのアプローチは、マルチフェイチャレコメンデーション設定において、複数の相互に依存するバンディット問題を効果的に学習・バランスできるか?
  • RQ2共有ニューラルネットワークによる複数バンディットの共同モデリングは、独立したバンディット学習よりも優れたレグレット性能をもたらすか?
  • RQ3個々のサブ報酬が入手不可な状況下で、アルゴリズムはどのように性能を示すか?
  • RQ4MuFasaは非線形報酬関数や複雑な実世界のデータ分布にどの程度一般化可能か?
  • RQ5弱い仮定の下で、提案手法の理論的レグレットバウンドは何か?

主な発見

  • MuFasaは、$ otimes ilde{ mathcal{O}}((K+1) sqrt{T})$ の近似的に最適なレグレットバウンドを達成し、コンテキストバンドイットの下界に理論的に近く、非常に優れた性能を示した。
  • Mnist+NotMnistデータセットでは、$H_1$ の最終報酬関数下でNeuUCB比17.8%、$H_2$ では20%のレグレット低減を達成した。
  • サブ報酬が1つしか利用できない状況下でも、MuFasa(One sub-reward)はYelpデータセットで、NeuUCBを含むすべてのベースラインを上回った。
  • サブ報酬が全く利用できない状況下でも、MuFasa(No sub-reward)はYelpでは最良のベースラインを下回るレグレットを達成し、Mnist+NotMnistでも競争力のある性能を示した。
  • ニューラルネットワークのアーキテクチャにより、MuFasaはバンディットの相対的重要性を学習可能となった(例:報酬に大きく寄与するバンディット1を優先的に処理)。その結果、より優れた意思決定が可能になった。
  • 実験では、MuFasaの共同モデリング能力のおかげで、個々のバンディットを独立して扱う手法を上回る性能が示された。特に、非対称的または非線形な報酬関数を持つ設定で顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。