Skip to main content
QUICK REVIEW

[論文レビュー] Learning Neural Contextual Bandits Through Perturbed Rewards

Yiling Jia, Weitong Zhang|arXiv (Cornell University)|Jan 24, 2022
Advanced Bandit Algorithms Research被引用数 4
ひとこと要約

本論文は、モデル更新時に報酬にガウスノイズを注入することで明示的探索を排除する、計算効率の良いニューラルコンテキストラベルドアルゴリズムを提案する。摂動を加えた報酬を活用することで、追加の計算コストを負わず、$ ilde{\mathbf{O}}(\widetilde{d}\sqrt{T})$ のレグレットバウンドを達成し、実世界のデータセットにおける効率性と実験的性能の両面で、既存のニューラルバンドイット手法を上回る性能を発揮する。

ABSTRACT

Thanks to the power of representation learning, neural contextual bandit algorithms demonstrate remarkable performance improvement against their classical counterparts. But because their exploration has to be performed in the entire neural network parameter space to obtain nearly optimal regret, the resulting computational cost is prohibitively high. We perturb the rewards when updating the neural network to eliminate the need of explicit exploration and the corresponding computational overhead. We prove that a $ ilde{O}( ilde{d}\sqrt{T})$ regret upper bound is still achievable under standard regularity conditions, where $T$ is the number of rounds of interactions and $ ilde{d}$ is the effective dimension of a neural tangent kernel matrix. Extensive comparisons with several benchmark contextual bandit algorithms, including two recent neural contextual bandit models, demonstrate the effectiveness and computational efficiency of our proposed neural bandit algorithm.

研究の動機と目的

  • ニューラルコンテキストラベルドアルゴリズムにおける明示的探索の高い計算コストを解消すること。
  • 深層ニューラルネットワークの信頼集合構築における高価な共分散行列の逆行列計算の必要性を排除すること。
  • 理論的なレグレット保証を維持しつつ、計算オーバーヘッドを著しく削減すること。
  • オンライン学習の文脈において、強力なニューラルバンドイットモデルの実用的導入を可能にすること。
  • ニューラルバンドイットアルゴリズムにおける理論的レグレットバウンドと実験的性能のギャップを埋めること。

提案手法

  • 各モデル更新時に、観測された報酬に平均0のガウスノイズを注入して、暗黙的探索を誘発する。
  • 摂動後の予測報酬が最大となる腕を選択することで、パrameter空間における明示的探索を回避する。
  • ニューラル接線カーネル(NTK)フレームワークを用いて、モデルの有効次元$\widetilde{d}$を分析する。
  • 摂動に基づく手法が、標準的な正則性条件の下で$\tilde{\mathbf{O}}(\widetilde{d}\sqrt{T})$ のレグレットを達成することを証明する。
  • 完全バッチの行列逆行列計算を避けるために、確率的勾配降下法をモデル更新に適用する。
  • 理論的根拠の欠落がある先行研究を避けるために、必要に応じてのみ対角近似を用いる。

実験結果

リサーチクエスチョン

  • RQ1明示的探索を放棄しても、報酬の摂動がレグレット保証を損なわずに代替可能か?
  • RQ2摂動報酬を用いるニューラルバンドイットアルゴリズムの理論的レグレットバウンドは何か?
  • RQ3提案手法の計算コストは、既存のニューラルバンドイットアルゴリズムと比べてどうか?
  • RQ4摂動ベースの手法は、実世界のデータセットにおいても優れた実験的性能を維持できるか?
  • RQ5大規模なニューラルネットワークに対しても、著しい計算コストを負わずスケーリング可能か?

主な発見

  • 提案手法は$\tilde{\mathbf{O}}(\widetilde{d}\sqrt{T})$ のレグレットバウンドを達成し、先行手法の理論的保証と一致する。
  • アルゴリズムは明示的探索を回避し、完全な共分散行列の逆行列計算の必要性も排除することで、計算コストを削減する。
  • LastFMおよびDeliciousデータセットにおいて、NPRはNeuralUCBおよびNeuralTSを上回る累積正規化報酬を達成した。
  • NPRは行列逆行列のオーバーヘッドが一切ないため、NeuralUCBおよびNeuralTSと比べて著しく高速な学習時間を達成した。
  • 合成データおよび実世界データの両方で、強力な実験的性能を維持し、その有効性を実証した。
  • オンラインニューラルバンドイット学習における主なボトル neck はモデル更新ステップにあり、本手法はその問題を効率的に解決した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。