Skip to main content
QUICK REVIEW

[論文レビュー] Neural Contextual Bandits with Deep Representation and Shallow Exploration

Pan Xu, Zheng Wen|arXiv (Cornell University)|Dec 3, 2020
Advanced Bandit Algorithms Research参考文献 47被引用数 18
ひとこと要約

この論文では、表現学習に深層ReLUニューラルネットワークを用い、最終層の線形層でのみ上界信頼区間(UCB)探索を実行する、コンテキストバンディットアルゴリズムNeural-LinUCBを提案する。計算コストを抑えるために、ネットワーク全体のパラメータ空間における探索を避けることで、線形バンディットと同等の$×{O}(ackslashsqrt{T})$のレグレットを達成する。

ABSTRACT

We study a general class of contextual bandits, where each context-action pair is associated with a raw feature vector, but the reward generating function is unknown. We propose a novel learning algorithm that transforms the raw feature vector using the last hidden layer of a deep ReLU neural network (deep representation learning), and uses an upper confidence bound (UCB) approach to explore in the last linear layer (shallow exploration). We prove that under standard assumptions, our proposed algorithm achieves $ ilde{O}(\sqrt{T})$ finite-time regret, where $T$ is the learning time horizon. Compared with existing neural contextual bandit algorithms, our approach is computationally much more efficient since it only needs to explore in the last layer of the deep neural network.

研究の動機と目的

  • 既存のニューラルコンテキストバンディットアルゴリズムが全深層ネットワークのパラメータ空間全体で探索を行うことによる計算非効率性を解消すること。
  • 生の高次元コンテキスト・アクション特徴量を扱うコンテキストバンディット設定において、サンプル効率とレグレット性能を向上させること。
  • 先行研究で経験的に観察された、深層表現学習と探索の分離の有効性を理論的に裏付けること。
  • 標準的な仮定の下で、ニューラルコンテキストバンディットアルゴリズムに対して非線形レグレットバウンドを確立すること。

提案手法

  • アルゴリズムは、生のコンテキスト・アクション特徴ベクトルを、最後の隠れ層での低次元表現に写像する深層ReLUニューラルネットワークを用いる。
  • 探索は、計算コストを最小限に抑えるために、最終層の線形層でのみ上界信頼区間(UCB)戦略を用いて実行する。
  • 過パラメータ化領域における深層ネットワークの一般化と収束を分析するために、ニューラル接線カーネル(NTK)理論を活用する。
  • 推定誤差のバウンドを、集中不等式と行列ノルムを用いて、最終層の重みの推定誤差を制御することで、レグレット解析を実施する。
  • 探索と活用のバランスを取るために、最終層パラメータの共分散行列と信頼区間を維持する。
  • 理論的解析では、線形コンテキストバンディットの技術(例:Abbasi-Yadkoriら、2011年)とNTKに基づく一般化バウンドを組み合わせる。

実験結果

リサーチクエスチョン

  • RQ1全ネットワークの探索を必要とせずに、深層ニューラルネットワークをコンテキストバンディットにおける表現学習に効果的に利用できるか?
  • RQ2表現学習と探索を分離することで、より良いレグレット性能と計算効率が得られるか?
  • RQ3ニューラルコンテキストバンディットアルゴリズムが、最良の線形バンディットアルゴリズムと同等の$\\widetilde{O}(\\sqrt{T})$のレグレットを達成できるか?
  • RQ4深層ネットワークの最終層に制限された探索のもとで、理論的レグレットバウンド$\\widetilde{O}(\\sqrt{T})$が達成可能か?

主な発見

  • 提案されたNeural-LinUCBアルゴリズムは、線形コンテキストバンディットの最適なレグレットレートと同等の$\\widetilde{O}(\\sqrt{T})$のレグレットバウンドを達成する。
  • 探索が最終層に限定されているため、全ネットワークの最適化を避けることで、従来のニューラルバンディット手法よりも計算的により効率的である。
  • 理論的解析により、深層表現学習と浅いUCB探索の組み合わせが、非線形レグレットをもたらすことが確認され、先行研究の経験的観察を裏付ける。
  • レグレットバウンドは、特徴ノルムの有界性と報酬におけるサブガウスノイズという標準的な仮定の下で導出された。
  • 過パラメータ化領域における深層ネットワークの一般化誤差をバウンドするために、ニューラル接線カーネル(NTK)理論を活用した。
  • 実世界のデータセットを用いた実験結果から、Neural-LinUCBは、全ネットワーク探索ベースラインと比較して著しく低い計算コストで優れた性能を達成することが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。