Skip to main content
QUICK REVIEW

[論文レビュー] Low-Rank Generalized Linear Bandit Problems

Yangyi Lu, Amirhossein Meisami|arXiv (Cornell University)|Jun 4, 2020
Advanced Bandit Algorithms Research参考文献 23被引用数 4
ひとこと要約

本稿では、オンラインから信頼集合への変換と低ランク行列被覆上での指数加重平均予測器を組み合わせることで、$×sim((d_1+d_2)^{3/2}√{rT})$ のレグレットを達成する、効率的な LowLOC および LowGLOC アルゴリズムを提案する。真のパラメータ行列 $Θ^*$ が低ランクである場合、標準的な線形バンディットのレグレット境界を改善し、弱い仮定のもとで予想される下界と一致するため、最適性が示される。

ABSTRACT

In a low-rank linear bandit problem, the reward of an action (represented by a matrix of size $d_1 imes d_2$) is the inner product between the action and an unknown low-rank matrix $Θ^*$. We propose an algorithm based on a novel combination of online-to-confidence-set conversion~\citep{abbasi2012online} and the exponentially weighted average forecaster constructed by a covering of low-rank matrices. In $T$ rounds, our algorithm achieves $\widetilde{O}((d_1+d_2)^{3/2}\sqrt{rT})$ regret that improves upon the standard linear bandit regret bound of $\widetilde{O}(d_1d_2\sqrt{T})$ when the rank of $Θ^*$: $r \ll \min\{d_1,d_2\}$. We also extend our algorithmic approach to the generalized linear setting to get an algorithm which enjoys a similar bound under regularity conditions on the link function. To get around the computational intractability of covering based approaches, we propose an efficient algorithm by extending the "Explore-Subspace-Then-Refine" algorithm of~\citet{jun2019bilinear}. Our efficient algorithm achieves $\widetilde{O}((d_1+d_2)^{3/2}\sqrt{rT})$ regret under a mild condition on the action set $\mathcal{X}$ and the $r$-th singular value of $Θ^*$. Our upper bounds match the conjectured lower bound of \cite{jun2019bilinear} for a subclass of low-rank linear bandit problems. Further, we show that existing lower bounds for the sparse linear bandit problem strongly suggest that our regret bounds are unimprovable. To complement our theoretical contributions, we also conduct experiments to demonstrate that our algorithm can greatly outperform the performance of the standard linear bandit approach when $Θ^*$ is low-rank.

研究の動機と目的

  • 計算的に困難な行列被覆に依存する従来の低ランクバンディットアルゴリズムの非効率性を解消すること。
  • アクション集合および $\Theta^*$ に対する最小限の仮定の下で、低ランク一般化線形バンディット問題のレグレット最適なアルゴリズムを開発すること。
  • オンラインから信頼集合への変換フレームワークを、低ランク行列設定に拡張し、より良いレグレット保証を得ること。
  • 計算的に重いベースラインの理論的レグレット境界と一致する、効率的かつ実装可能なアルゴリズムを提供すること。
  • 導出されたレグレット境界が、スパースおよび低ランクバンディット問題における既知の下界と結びついていることから、改善不能であることを実証すること。

提案手法

  • 低ランク行列の有限被覆上での指数加重平均予測器を用いた、新しいオンライン予測器を設計し、オンライン低ランク予測問題を解く。
  • Abbasi-Yadkori 他 (2012) のオンラインから信頼集合への変換フレームワークを適用し、オンライン予測レグレットを $\Theta^*$ に対する信頼集合に変換する。
  • 各ラウンドで信頼集合上で内積 $\langle X_t, \hat{\Theta}_t \rangle$ を最大化するように、楽観的なアクション選択を構築する。
  • リンク関数に正則性条件を満たす場合に適した、新しいオンラインから信頼集合への変換を設計することで、一般化線形バンディット設定にこの手法を拡張する。
  • Full matrix covering を回避するために、Jun 他 (2019) の「Explore-Subspace-Then-Refine」フレームワークを適応した効率的バージョン、Low-Rank-Explore-Subspace-Then-Refine を提案する。
  • 2段階アプローチを採用:まず $\Theta^*$ の低次元部分空間を探索し、次に正則化付き勾配ベース最適化を用いて推定値を精緻化する。

実験結果

リサーチクエスチョン

  • RQ1線形バンディット問題において、$\Theta^*$ の低ランク構造を活用しながら、$d_1 d_2$ に対して非線形のレグレットを達成できるか?
  • RQ2計算的に効率的な低ランクバンディットアルゴリズムを設計でき、計算的に重い被覆ベース手法のレグレット境界を達成できるか?
  • RQ3導出されたレグレット境界 $\u02dc{O}((d_1+d_2)^{3/2}\sqrt{rT})$ は、このクラスの問題に対する予想される下界と一致するか?
  • RQ4$\Theta^*$ の最小の正の特異値 $\omega_r$ とアルゴリズムの性能がどのようにスケーリングするか?
  • RQ5スパースおよび低ランクバンディット問題における既知の下界から、導出されたレグレット境界が改善不能であることが示唆される。
  • RQ6オンラインから信頼集合への変換フレームワークは、低ランクパラメータを持つ一般化線形バンディット設定に効果的に拡張可能か?

主な発見

  • 提案された LowLOC アルゴリズムは、低ランク線形バンディット問題において $\u02dc{O}((d_1+d_2)^{3/2}\sqrt{rT})$ のレグレットを達成し、$r \ll \min\{d_1,d_2\}$ の場合に標準的な $\u02dc{O}(d_1d_2\sqrt{T})$ の境界を改善する。
  • LowGLOC アルゴリズムは、リンク関数に正則性条件を満たす場合に一般化線形バンディット設定にこの結果を拡張し、同じレグレット境界を達成する。
  • レグレット境界は、Jun 他 (2019) が予想した低ランクバンディット問題のサブクラスに対する下界と一致し、最適性を示す。
  • 理論的分析により、スパース線形バンディット問題における既存の下界は、導出されたレグレット境界が改善不能であることを強く示唆する。
  • 実験により、$\Theta^*$ が低ランクである場合、標準的な線形バンディットベースライン(OFUL)と比較して、提案アルゴリズムが顕著に優れていることが示された。
  • 感度分析により、$\Theta^*$ の最小の正の特異値 $\omega_r$ が大きくなるほど、累積レグレットが減少することが確認され、理論的依存性 $\omega_r^{-1}$ が妥当であることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。