Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Objective Generalized Linear Bandits

Shiyin Lu, Guanghui Wang|arXiv (Cornell University)|May 30, 2019
Advanced Bandit Algorithms Research参考文献 17被引用数 5
ひとこと要約

本稿では、報酬が多次元的で一般化線形モデルに従う文脈的バンディット枠組みとして、マルチオブジェクティブ一般化線形バンディット(MOGLB)を導入する。MOGLB-UCBを提案し、パrameter推定にオンラインニュートンステップを用い、UCBに基づく探索によりパレートフロントの近似を構築することで、$\tilde{O}(d\sqrt{T})$ のパレートレグレットバウンドを達成し、最適な単一目的のバウンドと一致する。

ABSTRACT

In this paper, we study the multi-objective bandits (MOB) problem, where a learner repeatedly selects one arm to play and then receives a reward vector consisting of multiple objectives. MOB has found many real-world applications as varied as online recommendation and network routing. On the other hand, these applications typically contain contextual information that can guide the learning process which, however, is ignored by most of existing work. To utilize this information, we associate each arm with a context vector and assume the reward follows the generalized linear model (GLM). We adopt the notion of Pareto regret to evaluate the learner's performance and develop a novel algorithm for minimizing it. The essential idea is to apply a variant of the online Newton step to estimate model parameters, based on which we utilize the upper confidence bound (UCB) policy to construct an approximation of the Pareto front, and then uniformly at random choose one arm from the approximate Pareto front. Theoretical analysis shows that the proposed algorithm achieves an $ ilde O(d\sqrt{T})$ Pareto regret, where $T$ is the time horizon and $d$ is the dimension of contexts, which matches the optimal result for single objective contextual bandits problem. Numerical experiments demonstrate the effectiveness of our method.

研究の動機と目的

  • 既存のマルチオブジェクティブバンディットアルゴリズムにおける文脈情報の活用不足に対処すること。
  • 文脈ベクトル $x \in \mathbb{R}^d$ を用いて、複数の目的の報酬を一般化線形モデルでモデル化するフレームワークの開発。
  • パレート最適なアーム間の公平性を保ちながら、パレートレグレットを最小化すること。
  • 単一目的の文脈的バンディットの最適レグレットバウンドと一致するバウンドを達成すること。
  • 実世界の応用(推薦やネットワークルーティングなど)において理論的に裏付けられ、実用的に効果的なアルゴリズムの提供。

提案手法

  • 各アームの報酬ベクトルを、$m$ 個の目的と文脈ベクトル $x \in \mathbb{R}^d$ を用いた一般化線形モデルでモデル化する。
  • パrameter化可能実現可能性を仮定:$\mathbb{E}[y^i|x] = \mu_i(\theta_i^\top x)$ であり、未知の係数 $\theta_i$ とリンク関数 $\mu_i$ を有する。
  • 時間経過に伴いモデルパラメータ $\theta_i$ を推定するために、オンラインニュートンステップの変種を用いる。
  • 期待報酬の信頼区間に基づく上界信頼性(UCB)ポリシーを適用し、期待報酬の信頼区間から近似パレートフロントを構築する。
  • 公平性を確保するため、近似パレートフロントからアームを一様にランダムに選択する。
  • 数値的安定性のため、信頼集合の幅 $\gamma_t = c \log{\frac{\det(Z_t)}{\det(Z_1)}}$ と正則化 $\lambda = \max(1, \kappa/2)$ を用いる。

実験結果

リサーチクエスチョン

  • RQ1一般化線形報酬モデル下で、マルチオブジェクティブ文脈的バンディットアルゴリズムがサブラインアーなパレートレグレットを達成できるか?
  • RQ2レグレットを最小化しつつ、パレート最適なアーム間の公平性を維持できるか?
  • RQ3提案されたアルゴリズムが、単一目的の文脈的バンディットの最適レグレットバウンドと一致するか?
  • RQ4既存のMOBおよびMOCBベースラインと比較して、レグレットとパレートフロントの正確性において、アルゴリズムの性能はいかがなっているか?
  • RQ5文脈情報を効果的に活用することで、学習効率が向上するか?

主な発見

  • 提案されたMOGLB-UCBアルゴリズムは、$\tilde{O}(d\sqrt{T})$ のパレートレグレットバウンドを達成し、単一目的の文脈的バンディットの最適バウンドと一致する。
  • 数値実験の結果、すべての設定において、S-UCBおよびP-TSと比較して、MOGLB-UCBは累積パレートレグレットで顕著に優れている。
  • $t > 1500$ の時点で、Jaccard指数が高いため、P-UCBおよびP-TSよりもMOGLB-UCBは真のパレートフロントに早く収束することが示された。
  • MOGLB-UCBが構築する近似パレートフロントは真のパレートフロントに近く、フロント推定の高精度を示している。
  • 近似パレートフロントから一様にサンプリングすることで、公平性を維持し、パレート最適なアームのいずれかが優遇されないことを保証している。
  • 特に $\lambda$ および $\gamma_t$ に対して、性能に感受性が低いため、ハイパーパrameterの選択に対して頑健である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。